中文

从填充到编辑:基于生成式引导实现无掩模鲁棅视觉配音

计算机视觉与模式识别 2026-03-25 v2

摘要

音频驱动的视觉配音旨在同步视频的唇部动作与新语音,但面临着缺乏仅因唇部动作不同而其余部分相同的理想训练数据的挑战。现有方法通过基于掩模的填充来规避这一问题。然而,掩模处理不可避免地破坏了时空上下文,导致身份漂移和较差鲁棒性(例如对遮挡不敏感),同时还会引发唇形泄漏,影响唇部同步质量。为弥合这一差距,我们提出了X-Dub,一种新的两阶段生成式引导框架,利用强大的扩散转换器实现无掩模配音。我们的核心思想是将掩模填充模型专门用作数据生成器,以合成可扩展且高保真度的伪配对数据,随后用于训练和引导一个稳健、无掩模编辑模型作为最终视频配音器。最终配音器摆脱了掩模造成的伪影,利用完整视频输入实现高保真推理。我们进一步引入时步自适应多阶段学习,以在扩散阶段中分离冲突目标(结构、唇部动作和纹理),促进稳定收敛和高级编辑质量。此外,我们提出X-DubBench,一个涵盖多种场景的基准。大量实验表明,我们的方法以卓越的唇部同步、视觉质量和鲁棒性实现了最先进的性能。

关键词

引用

@article{arxiv.2512.25066,
  title  = {From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping},
  author = {Xu He and Haoxian Zhang and Hejia Chen and Changyuan Zheng and Liyang Chen and Songlin Tang and Jiehui Huang and Xiaoqiang Liu and Pengfei Wan and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2512.25066},
  year   = {2026}
}

备注

Project Page: https://github.com/KlingAIResearch/X-Dub