中文

Wan-S2V:面向电影级视频生成的音频驱动方法

计算机视觉与模式识别 2025-08-27 v1

摘要

当前面向音频驱动角色动画的 state-of-the-art(SOTA)方法在主要涉及语音和歌唱的场景方面表现有希望,但在更复杂的电影和电视制作中常常不足,这些制作需要细致的角色互动、真实的身体动作和动态的摄像机工作。为解决实现电影级角色动画的 long-standing 挑战,我们提出了一种音频驱动模型,称为 Wan-S2V,基于 Wan 开发。我们的方法在电影上下文中实现了对现有方法而言的显著提升的表达性和保真度。我们进行了大量实验,将该方法与 Hunyuan-Avatar 和 Omnihuman 等最前沿模型进行基准测试。实验结果一致显示,我们的方法显著优于这些现有解决方案。此外,我们通过在长形式视频生成和精确视频lip-sync 编辑中的应用,探索了该方法的多样性。

关键词

引用

@article{arxiv.2508.18621,
  title  = {Wan-S2V: Audio-Driven Cinematic Video Generation},
  author = {Xin Gao and Li Hu and Siqi Hu and Mingyang Huang and Chaonan Ji and Dechao Meng and Jinwei Qi and Penchong Qiao and Zhen Shen and Yafei Song and Ke Sun and Linrui Tian and Guangyuan Wang and Qi Wang and Zhongjian Wang and Jiayu Xiao and Sheng Xu and Bang Zhang and Peng Zhang and Xindi Zhang and Zhe Zhang and Jingren Zhou and Lian Zhuo},
  journal= {arXiv preprint arXiv:2508.18621},
  year   = {2025}
}