Vidu:一种基于扩散模型的高一致性、动态且技能强的文本到视频生成器
计算机视觉与模式识别
2024-05-08 v1 机器学习
摘要
我们介绍 Vidu,这是一个高性能的文本到视频生成器,能够在单次生成中生成最长 16 秒、分辨率为 1080p 的视频。Vidu 采用 U-ViT 作为底层架构的扩散模型,这使其具备处理长视频的可扩展性和能力。Vidu 显示出强大的连贯性和动态性,能够生成真实与想象的视频,甚至能够理解一些专业摄影技巧,水平与 Sora —— 当前报告的最强文本到视频生成器 —— 持平。最后,我们对其他可控视频生成进行初始实验,包括基于 canny 的视频生成、视频预测和主体驱动的生成,这些实验都显示出有前景的效果。
引用
@article{arxiv.2405.04233,
title = {Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models},
author = {Fan Bao and Chendong Xiang and Gang Yue and Guande He and Hongzhou Zhu and Kaiwen Zheng and Min Zhao and Shilong Liu and Yaole Wang and Jun Zhu},
journal= {arXiv preprint arXiv:2405.04233},
year = {2024}
}
备注
Project page at https://www.shengshu-ai.com/vidu