SkyReels-V2:无限时长电影生成模型
计算机视觉与模式识别
2025-04-22 v3
摘要
视频生成的最新进展由扩散模型和自回归框架推动,但在协调提示遵循性、视觉质量、运动动态和时长方面仍面临关键挑战:为提升时序视觉质量而牺牲运动动态,为优先分辨率而限制视频时长(5-10 秒),以及由于通用大语言模型(MLLM)无法解释电影语法(如镜头构图、演员表情、摄像机运动)导致的shot-aware生成不足。这些交织的局限性阻碍了真实长篇合成和专业电影风格生成。为解决这些问题,我们提出SkyReels-V2,一个无限时长电影生成模型,融合了多模态大语言模型(MLLM)、多阶段预训练、强化学习和扩散强制框架。首先,我们设计了将通用描述与子专家模型详细shot语言结合的视频综合结构表示。结合人工标注,我们随后训练了一个统一的Video Captioner,命名为SkyCaptioner-V1,用于高效标注视频数据。其次,我们为基础视频生成建立渐进分辨率预训练,随后进行四阶段后训练增强:初始概念平衡监督微调(SFT)改善基线质量;针对动态伪影的运动专用强化学习训练;采用非递增噪声计划的扩散强制框架实现长视频高效合成;最终高质量SFT提升视觉保真度。所有代码和模型均已公开 https://github.com/SkyworkAI/SkyReels-V2。
引用
@article{arxiv.2504.13074,
title = {SkyReels-V2: Infinite-length Film Generative Model},
author = {Guibin Chen and Dixuan Lin and Jiangping Yang and Chunze Lin and Junchen Zhu and Mingyuan Fan and Hao Zhang and Sheng Chen and Zheng Chen and Chengcheng Ma and Weiming Xiong and Wei Wang and Nuo Pang and Kang Kang and Zhiheng Xu and Yuzhe Jin and Yupeng Liang and Yubing Song and Peng Zhao and Boyuan Xu and Di Qiu and Debang Li and Zhengcong Fei and Yang Li and Yahui Zhou},
journal= {arXiv preprint arXiv:2504.13074},
year = {2025}
}
备注
31 pages,10 figures