中文

SkyReels-Audio:视频扩散 Transformer 中的全能音频条件说话人肖像

计算机视觉与模式识别 2025-06-03 v1

摘要

由文本、图像和视频等多模态输入引导的音频条件说话人肖像的生成与编辑仍处于探索不足的阶段。在本文中,我们提出了 SkyReels-Audio,一个用于合成高保真和时间连贯的说话人肖像视频的统一框架。基于预训练的视频扩散 Transformer,我们的框架支持无限长度的生成与编辑,同时通过多模态输入实现多样且可控的条件化。我们采用混合课程学习策略逐步将音频与面部运动对齐,从而实现对长视频序列的细粒度多模态控制。为了增强局部面部连贯性,我们引入了面部掩码损失和音频引导的无分类器引导机制。滑动窗口去噪方法进一步融合了跨时间段隐式表示,确保在较长持续时间和不同身份下的视觉保真度和时间一致性。更重要的是,我们构建了专门的数据流水线,用于整理由同步音频、视频和文本描述组成的高质量三元组。全面的基准评估表明,SkyReels-Audio 在唇形同步准确度、身份一致性和真实面部动态方面达到了卓越的性能,尤其是在复杂和具有挑战性的条件下。

关键词

引用

@article{arxiv.2506.00830,
  title  = {SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers},
  author = {Zhengcong Fei and Hao Jiang and Di Qiu and Baoxuan Gu and Youqiang Zhang and Jiahua Wang and Jialin Bai and Debang Li and Mingyuan Fan and Guibin Chen and Yahui Zhou},
  journal= {arXiv preprint arXiv:2506.00830},
  year   = {2025}
}