阿里云推视频生成大模型未来可应用于电影制作

柏纳

2023-09-06 13:20

9月6日消息，阿里云近日推出全新视频生成大模型I2VGen-XL，并在魔搭社区开放体验，用户上传一张图片后2分钟左右即可生成一段1280*720的高分辨率视频，该模型研发负责人表示，未来将进一步实现2K超清效果，可应用于短视频内容生产、电影制作等场景。

format-jpg

截自魔塔社区官网

据介绍，和业界爆火的AI绘画创作大模型不同，视频生成大模型的技术门槛更高，其需要克服文本和视频内容匹配度、视频画面质量、画面连续性等诸多技术挑战。

在此之前，阿里云和微软等科技公司相继推出一系列可控视频生成研究成果，例如用户可通过定义空间布局、运动模式等条件来生成视频，但其画面清晰度难以满足真实场景应用的需求。

针对该问题，阿里云进一步提出创新思路，I2VGen-XL模型设计了两个阶段，首先在低分辨率条件下保证生成结果和给定图像语义的匹配度，随后通过视频扩散模型（VLDM）来提高视频分辨率，并同时提升时间和空间上的一致性，保证最终视频内容的清晰度和连贯性，最终实现1280*720高分辨率的突破，并且在画面细节的展现上大幅领先现有模型。

该模型的训练还使用了多种风格的视频数据，因此可生成科技感、电影色、卡通风格和素描等类型丰富的视频。

format-jpg

I2VGen-XL流程图；截自魔塔社区官网

目前，I2VGen-XL的模型和代码均已开源，国内外社交媒体显示，该模型已吸引国内外用户和开发者的广泛体验和二次开发，涌现了大量创意AI视频生成内容，例如在城堡上展翅的恐龙、宇航员在飞船中行走的科幻电影画面等等。

在视觉生成领域，阿里云此前已推出AI绘画创作大模型通义万相（基座模型Composer）和可控视频生成模型VideoComposer，团队在该领域发表60多篇CCF-A类论文，并在国际顶级视觉竞赛中获得10余项冠军。

format-jpg

截自魔塔社区官网

值得一提的是，根据国家七部委联合公布的《生成式人工智能服务管理暂行办法》指导要求，阿里大模型“通义千问”已完成备案工作，待正式上线。

声明

1、该内容为作者独立观点，不代表电商派观点或立场，文章为作者本人上传，版权归原作者所有，未经允许不得转载。
2、电商号平台仅提供信息存储服务，如发现文章、图片等侵权行为，侵权责任由作者本人承担。
3、如对本稿件有异议或投诉，请联系：info@dsb.cn

阿里云推视频生成大模型 未来可应用于电影制作

阿里云推视频生成大模型未来可应用于电影制作