SyncAnyone:面向野外唇音同步的基于渐进式自校正的隐式解耦
计算机视觉与模式识别
2026-02-09 v3
摘要
高质量的 AI 视频配音要求精确的音唇同步、高保真的视觉生成以及对身份和背景的忠实保留。现有大多数方法依赖基于掩码的训练策略,即在说话人视频中掩码嘴部区域,模型从受损输入和目标音频中学习合成唇部运动。虽然这有助于提升唇音同步精度,但它破坏了时空上下文,损害了动态面部运动的性能,并导致面部结构和背景一致性不稳定。为克服这一局限性,我们提出了 SyncAnyone,一种新型两阶段学习框架,可同时实现精确运动建模和高视觉保真度。在阶段 1 中,我们训练了一个基于扩散的视频 Transformer 用于掩码嘴部修复,利用其强大的时空建模能力生成精确的、音频驱动的唇部运动。然而,由于输入受损,周围面部区域和背景中可能出现轻微伪影。在阶段 2 中,我们开发了一个无掩码微调流水线以解决掩码引起的伪影。具体而言,在阶段 1 模型的基础上,我们开发了一个数据生成流水线,通过从源视频和随机采样音频合成唇音同步视频来创建伪配对训练样本。我们在此合成数据上进一步微调阶段 2 模型,实现了精确的唇部编辑和更好的背景一致性。大量实验表明,我们的方法在野外唇音同步场景下的视觉质量、时间连贯性和身份保留方面取得了 SOTA 结果。
引用
@article{arxiv.2512.21736,
title = {SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild},
author = {Xindi Zhang and Dechao Meng and Steven Xiao and Qi Wang and Peng Zhang and Bang Zhang},
journal= {arXiv preprint arXiv:2512.21736},
year = {2026}
}
备注
Project page: https://humanaigc.github.io/sync_anyone_demo_page/