中文

OmniSync:基于 Diffusion Transformer 的通用唇音同步

计算机视觉与模式识别 2025-09-19 v2

摘要

唇音同步是将视频中说话者的唇部运动与相应语音音频对齐的任务,对于创建逼真、富有表现力的视频内容至关重要。然而,现有方法通常依赖参考帧和掩码帧修复,这限制了它们在身份一致性、姿态变化、面部遮挡和风格化内容方面的鲁棒性。此外,由于音频信号提供的条件约束弱于视觉线索,原始视频的唇形泄漏会影响唇音同步质量。本文提出 OmniSync,一个适用于多种视觉场景的通用唇音同步框架。该方法引入无掩码训练范式,使用 Diffusion Transformer 模型进行无需显式掩码的直接帧编辑,在保持自然面部动态和保留角色身份的同时实现无限时长的推理。在推理阶段,提出基于流匹配的渐进式噪声初始化,以确保姿态和身份一致性,同时允许精确的嘴部区域编辑。针对音频条件信号弱的问题,开发了动态时空无分类器引导(DS-CFG)机制,在时间和空间上自适应调整引导强度。还建立了 AIGC-LipSync Benchmark,这是首个用于评估多种 AI 生成视频中唇音同步的测试套件。大量实验表明,OmniSync 在视觉质量和唇音同步精度上均显著优于现有方法,在真实视频和 AI 生成视频中均取得优异结果。

关键词

引用

@article{arxiv.2505.21448,
  title  = {OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers},
  author = {Ziqiao Peng and Jiwen Liu and Haoxian Zhang and Xiaoqiang Liu and Songlin Tang and Pengfei Wan and Di Zhang and Hongyan Liu and Jun He},
  journal= {arXiv preprint arXiv:2505.21448},
  year   = {2025}
}

备注

Accepted as NeurIPS 2025 spotlight