中文

CogVideoX:基于专家变换器的文本到视频扩散模型

计算机视觉与模式识别 2025-03-27 v3

摘要

我们提出CogVideoX,一个基于扩散变换器的大规模文本到视频生成模型,可生成与文本提示一致的10秒连续视频,帧率为16 fps,分辨率为768×1360像素。以往的视频生成模型常受限于运动范围有限、时长短小,难以基于文本生成具有连贯叙事的视频。我们提出了多个设计以解决这些问题。首先,我们提出3D变分自编码器(VAE),在空间和时间维度上压缩视频,以提高压缩率和视频保真度。其次,为提高文本与视频的对齐方式,提出具有专家自适应LayerNorm的专家变换器,以促进两种模态的深度融合。此外,通过采用渐进式训练和多分辨率帧包技术,CogVideoX擅长生成连贯、时长较长、形状不同的视频,具有显著运动。此外,我们开发了有效的文本到视频数据处理管道,包括各种数据预处理策略和视频描述方法,大幅提升生成质量和语义对齐。结果表明,CogVideoX在多个机器指标和人类评估中显示出领先性能。CogVideoX的模型权重(包括3D因果VAE、视频描述模型和CogVideoX)已在https://github.com/THUDM/CogVideo公开提供。

关键词

引用

@article{arxiv.2408.06072,
  title  = {CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer},
  author = {Zhuoyi Yang and Jiayan Teng and Wendi Zheng and Ming Ding and Shiyu Huang and Jiazheng Xu and Yuanming Yang and Wenyi Hong and Xiaohan Zhang and Guanyu Feng and Da Yin and Yuxuan Zhang and Weihan Wang and Yean Cheng and Bin Xu and Xiaotao Gu and Yuxiao Dong and Jie Tang},
  journal= {arXiv preprint arXiv:2408.06072},
  year   = {2025}
}

备注

Accepted by ICLR2025