中文

SkyReels-V4:多模态视频音频生成、填充与编辑模型

计算机视觉与模式识别 2026-03-19 v3

摘要

SkyReels V4 是一个统一的多模态视频基础模型,支持联合视频音频生成、填充和编辑。该模型采用双流多模态扩散转换器(MMDiT)架构,其中一个分支合成视频,另一个生成同步的音频,同时共享基于多模态大语言模型(MLLM)的强大文本编码器。SkyReels V4 接受丰富的多模态指令,包括文本、图像、视频片段、掩码和音频参考。通过将 MLLM 的多模态指令遵循能力与视频分支 MMDiT 中的上下文学习相结合,模型能够在复杂条件下注入细粒度的视觉指导,同时音频分支 MMDiT 利用音频参考指导声音生成。在视频侧,我们采用通道拼接公式,将一系列填充样式任务,如图像到视频、视频扩展和视频编辑,统一到单个接口下,并自然地扩展到通过多模态提示实现视觉参考填充和编辑。SkyReels V4 支持最高 1080p 分辨率、32 FPS 和 15 秒持续时间,实现高保真、多镜头、电影级视频生成并实现音频同步。为使如此高分辨率和长时长生成在计算上可行,我们引入一种效率策略:先生成低分辨率的完整序列和高分辨率的关键帧,然后通过专门的超分辨率和帧插值模型进行处理。据我们了解,SkyReels V4 是首个同时支持多模态输入、联合视频音频生成以及统一处理生成、填充和编辑的视频基础模型,同时在电影级分辨率和持续时间下保持强大的效率和质量。

关键词

引用

@article{arxiv.2602.21818,
  title  = {SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model},
  author = {Guibin Chen and Dixuan Lin and Jiangping Yang and Youqiang Zhang and Zhengcong Fei and Debang Li and Sheng Chen and Chaofeng Ao and Nuo Pang and Yiming Wang and Yikun Dou and Zheng Chen and Mingyuan Fan and Tuanhui Li and Mingshan Chang and Hao Zhang and Xiaopeng Sun and Jingtao Xu and Yuqiang Xie and Jiahua Wang and Zhiheng Xu and Weiming Xiong and Yuzhe Jin and Baoxuan Gu and Binjie Mao and Yunjie Yu and Jujie He and Yuhao Feng and Shiwen Tu and Chaojie Wang and Rui Yan and Wei Shen and Jingchen Wu and Peng Zhao and Xuanyue Zhong and Zhuangzhuang Liu and Kaifei Wang and Fuxiang Zhang and Weikai Xu and Wenyan Liu and Binglu Zhang and Yu Shen and Tianhui Xiong and Bin Peng and Liang Zeng and Xuchen Song and Haoxiang Guo and Peiyu Wang and Max W. Y. Lam and Chien-Hung Liu and Yahui Zhou},
  journal= {arXiv preprint arXiv:2602.21818},
  year   = {2026}
}