中文

SayAnything:基于条件视频扩散的音频驱动 lip 同步

计算机视觉与模式识别 2025-02-18 v1

摘要

近期扩散模型的进展推动了音频驱动 lip 同步的显著进步。然而,现有方法通常依赖受限的音频-视觉对齐先验或通过学习中间表示来强制 lip 动作合成,导致训练流程复杂且运动自然性有限。本文提出了 SayAnything,一个从音频输入直接合成 lip 动作并保持说话人身份的条件视频扩散框架。具体而言,我们提出了三个专门模块:身份保留模块、音频引导模块和编辑控制模块。新型设计有效平衡了不同条件信号在潜在空间中的权重,实现对外观、运动和区域特定生成的精确控制,而无需额外监督信号或中间表示。广泛的实验表明,SayAnything 生成的视频高度逼真,lip-牙齿一致性得到提升,能够实现未见角色的“说任何话”,并能有效泛化到动画角色。

关键词

引用

@article{arxiv.2502.11515,
  title  = {SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion},
  author = {Junxian Ma and Shiwen Wang and Jian Yang and Junyi Hu and Jian Liang and Guosheng Lin and Jingbo chen and Kai Li and Yu Meng},
  journal= {arXiv preprint arXiv:2502.11515},
  year   = {2025}
}