近日,阿里云推出全新视频生成大模型I2VGen-XL,并在魔搭社区开放体验,用户上传一张图片后2分钟左右即可生成一段1280*720的高分辨率视频,该模型研发负责人表示,未来将进一步实现2K超清效果,可应用于短视频内容生产、电影制作等场景。
与传统的AI绘画创作大模型不同,视频生成大模型的技术门槛更高,需要克服文本和视频内容匹配度、视频画面质量、画面连续性等诸多技术挑战。此前,阿里云已推出一系列可控视频生成研究成果,但画面清晰度难以满足真实场景应用的需求。
为解决这一问题,I2VGen-XL模型设计了两个阶段。首先在低分辨率条件下保证生成结果和给定图像语义的匹配度,随后通过视频扩散模型(VLDM)来提高视频分辨率,并同时提升时间和空间上的一致性,保证最终视频内容的清晰度和连贯性。据介绍,该模型的训练还使用了多种风格的视频数据,因此可生成科技感、电影色、卡通风格和素描等类型丰富的视频。
目前,I2VGen-XL的模型和代码均已开源,并吸引了国内外用户和开发者的广泛体验和二次开发。大量创意AI视频生成内容涌现,包括城堡上展翅的恐龙、宇航员在飞船中行走的科幻电影画面等。知名AI社交媒体分析师Ahsen Khaliq发布多条由该模型生成的视频效果,并表示模型在清晰度、纹理、语义和时间连续性方面具有优势。
此前,阿里云已推出AI绘画创作大模型通义万相(基座模型Composer)和可控视频生成模型VideoComposer,并在视觉生成领域发表了60多篇CCF-A类论文,并在国际顶级视觉竞赛中获得10余项冠军。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...