MUG-V 10B:大规模视频生成模型的高效训练管道
计算机视觉与模式识别
2025-10-23 v2 人工智能
摘要
近年来,针对视觉内容(如图像、视频和3D对象/场景)的大规模生成模型取得了显著进展。然而,训练大规模视频生成模型仍然具有挑战性且资源密集,主要due to 跨模态文本-视频对齐、长序列涉及以及复杂的时空依赖关系。为此,我们提出了一套训练框架,优化了四个支柱:(i)数据处理,(ii)模型架构,(iii)训练策略,以及(iv)大规模视频生成模型的基础设施。这些优化在数据预处理、视频压缩、参数扩展、基于课程的预训练以及以对齐为导向的后训练等所有阶段均实现了显著的效率提升和性能改进。我们得到的模型MUG-V 10B在整体上匹配了最新的视频生成器, 在以电商为导向的视频生成任务中, 在人类评估中超越了领先的开源基线。更重要的是,我们开源了完整的技术栈,包括模型权重、基于Megatron-Core的大规模训练代码以及用于视频生成和增强的推理管道。据我们了解,这是首个公开发布的大规模视频生成训练代码,利用Megatron-Core实现高训练效率和近乎线性多节点扩展,详情请参见 https://github.com/Shopee-MUG/MUG-V。
关键词
引用
@article{arxiv.2510.17519,
title = {MUG-V 10B: High-efficiency Training Pipeline for Large Video Generation Models},
author = {Yongshun Zhang and Zhongyi Fan and Yonghang Zhang and Zhangzikang Li and Weifeng Chen and Zhongwei Feng and Chaoyue Wang and Peng Hou and Anxiang Zeng},
journal= {arXiv preprint arXiv:2510.17519},
year = {2025}
}
备注
Technical Report; Project Page: https://github.com/Shopee-MUG/MUG-V