中文

Vchitect-2.0:扩展视频扩散模型的并行 Transformer

计算机视觉与模式识别 2025-01-16 v1 机器学习

摘要

我们提出 Vchitect-2.0, 一个为大规模文本到视频生成而设计的并行 Transformer 架构。Vchitect-2.0 系统具有若干关键设计要点。(1) 通过引入一种新型多模态扩散模块, 我们的做法实现了文本描述与生成视频帧之间的一致对齐, 同时保持序列跨时间的一致性。(2) 为克服内存和计算瓶颈, 我们提出了一种记忆高效训练框架, 融合混合并行策略和其他记忆约减技术, 使在分布式系统上训练长视频序列成为高效可能。(3) 此外, 我们增强的数据处理管道确保通过严格的标注和审美评估, 创建了 Vchitect T2V DataVerse, 一个规模达百万级的高质量训练数据集。广泛的基准测试表明, Vchitect-2.0 在视频质量、训练效率和可扩展性方面优于现有方法, 作为高保真视频生成的合适基础。

关键词

引用

@article{arxiv.2501.08453,
  title  = {Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models},
  author = {Weichen Fan and Chenyang Si and Junhao Song and Zhenyu Yang and Yinan He and Long Zhuo and Ziqi Huang and Ziyue Dong and Jingwen He and Dongwei Pan and Yi Wang and Yuming Jiang and Yaohui Wang and Peng Gao and Xinyuan Chen and Hengjie Li and Dahua Lin and Yu Qiao and Ziwei Liu},
  journal= {arXiv preprint arXiv:2501.08453},
  year   = {2025}
}