StableDub:驯服扩散先验以实现泛化且高效的视觉配音
计算机视觉与模式识别
2025-09-29 v1 多媒体
摘要
视觉配音任务旨在生成与驱动音频同步的嘴部运动,近年来取得了显著进展。然而,两个关键缺陷阻碍了其广泛应用:(1) 仅音频驱动范式无法充分捕捉特定说话者的唇部习惯,导致无法生成与目标虚拟形象相似的唇部运动;(2) 传统的盲修复方法在处理遮挡物(如麦克风、手)时经常产生视觉伪影,限制了其实际部署。在本文中,我们提出了 StableDub,一个将唇部习惯感知建模与遮挡鲁棒合成相结合的新颖且简洁的框架。具体而言,在 Stable-Diffusion 骨干网络的基础上,我们开发了一种唇部习惯调制机制,联合建模音素级音视频同步和特定说话者的面部动态。为了在遮挡下获得合理的唇部几何形状和物体外观,我们引入了遮挡感知训练策略,通过将遮挡物体显式暴露于修复过程中来实现。通过结合所提出的设计,该模型消除了先前方法中对计算密集型先验的需求,从而在计算密集的基于扩散的骨干网络上展现出卓越的训练效率。为了从模型架构角度进一步优化训练效率,我们引入了混合 Mamba-Transformer 架构,展示了在低资源研究场景中增强的适用性。广泛的实验结果表明,StableDub 在唇部习惯相似性和遮挡鲁棒性方面取得了优越的性能。我们的方法在音频-唇部同步、视频质量和分辨率一致性方面也超越了其他方法。我们从综合方面扩展了视觉配音方法的适用性,演示视频可在 https://stabledub.github.io 找到。
引用
@article{arxiv.2509.21887,
title = {StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing},
author = {Liyang Chen and Tianze Zhou and Xu He and Boshi Tang and Zhiyong Wu and Yang Huang and Yang Wu and Zhongqian Sun and Wei Yang and Helen Meng},
journal= {arXiv preprint arXiv:2509.21887},
year = {2025}
}