中文

ContentV:高效训练视频生成模型(计算资源有限)

计算机视觉与模式识别 2025-06-12 v2

摘要

近期视频生成技术的进步日益需求更高效的训练方案以缓解不断上升的计算成本。本报告中,我们提出ContentV——一个80亿参数的文本到视频模型,在仅使用256块64GB NPU进行四周训练后,即可达到VBench 85.14的领先性能。ContentV能够从文本提示生成多分辨率、多时长的多样化高质量视频,其背后源自三项关键创新:(1)极简化架构,最大化预训练图像生成模型在视频生成中的复用;(2)系统化的多阶段训练策略,利用流匹配提升效率;(3)面向成本效益的强化学习与人类反馈框架,在无需额外人类标注的情况下提升生成质量。所有代码与模型已公开于:https://contentv.github.io。

关键词

引用

@article{arxiv.2506.05343,
  title  = {ContentV: Efficient Training of Video Generation Models with Limited Compute},
  author = {Wenfeng Lin and Renjie Chen and Boyuan Liu and Shiyue Yan and Ruoyu Feng and Jiangchuan Wei and Yichen Zhang and Yimeng Zhou and Chao Feng and Jiao Ran and Qi Wu and Zuotao Liu and Mingyu Guo},
  journal= {arXiv preprint arXiv:2506.05343},
  year   = {2025}
}

备注

Project Page: https://contentv.github.io