SkyReels-V3 技术报告
计算机视觉与模式识别
2026-01-30 v2
摘要
视频生成是构建世界模型的基石,多模态上下文推断是其能力的关键测试。为此,我们提出了 SkyReels-V3,一种基于统一多模态 in-context 学习框架构建的条件视频生成模型。SkyReels-V3 模型在单一架构中支持三种核心生成范式:参考图像到视频合成、视频到视频延伸和音频引导视频生成。 (i) 参考图像到视频模型旨在生成高保真度视频,保留强大的主体身份、时间一致性和叙事一致性。为增强参考遵循性和组成稳定性,我们设计了综合的数据处理管道,利用跨帧配对、图像编辑和语义重写,有效缓解了复制粘贴痕迹。在训练期间,采用图像视频混合策略结合多分辨率联合优化,以提高在各种场景下的泛化能力和鲁棒性。 (ii) 视频延伸模型集成了时空一致性建模与大规模视频理解,实现了无缝的单镜头续拍和基于专业摄影技巧的智能多镜头切换。 (iii) 说话人形象模型通过训练首尾帧插入模式,重建关键帧推理范式,支持分钟级音频条件视频生成。在确保视觉质量的基础上,优化了音视频同步。广泛的评估表明,SkyReels-V3 在包括视觉质量、指令遵循和特定指标在内的关键指标上实现了最先进或接近最先进的性能,接近领先的闭源系统。Github: https://github.com/SkyworkAI/SkyReels-V3。
引用
@article{arxiv.2601.17323,
title = {SkyReels-V3 Technique Report},
author = {Debang Li and Zhengcong Fei and Tuanhui Li and Yikun Dou and Zheng Chen and Jiangping Yang and Mingyuan Fan and Jingtao Xu and Jiahua Wang and Baoxuan Gu and Mingshan Chang and Wenjing Cai and Yuqiang Xie and Binjie Mao and Youqiang Zhang and Nuo Pang and Hao Zhang and Yuzhe Jin and Zhiheng Xu and Dixuan Lin and Guibin Chen and Yahui Zhou},
journal= {arXiv preprint arXiv:2601.17323},
year = {2026}
}