基于Lipschitz连续性的VQ-AE噪声鲁棒性用于ID特定说话人头像的高频纹理修复
计算机视觉与模式识别
2025-06-10 v3
摘要
音频驱动IDentity-specific Talking Head Generation(ID-specific THG)正在为电影制作和虚拟现实应用取得显著进展。现有方法通常构建为端到端范式,已取得显著进展。然而,它们往往难以捕获高频纹理,因为模型容量有限。为此,我们采用一种简单而高效的后处理框架——不同于专注于端到端训练的先前研究——基于我们的理论见解。具体而言,利用神经网络的Lipschitz连续性理论,我们证明了Vector Quantized AutoEncoder(VQ-AE)的一个关键噪声容忍性质,并建立了噪声鲁棒性上界(NRoUB)的存在。这一洞见表明,我们可以在不额外构建网络的情况下,通过训练一个identity-specific神经离散表示来高效获得一个identity-specific去噪器。基于这一理论基础,我们提出了一个具有增强NRoUB的即插即用空间优化VQ-AE(SO-VQAE),以实现时序一致去噪。为实际部署,我们进一步引入一个将预训练的Wav2Lip模型与SO-VQAE组合的级联管道,用于ID-specific THG。我们的实验表明,该管道在视频质量和鲁棒性方面实现了前沿性能,超越了现有的identity-specific THG方法。此外,该管道仅需几小时消费级GPU时间,实时运行,既高效又实用,适用于行业应用。
引用
@article{arxiv.2410.00990,
title = {Lipschitz-Driven Noise Robustness in VQ-AE for High-Frequency Texture Repair in ID-Specific Talking Heads},
author = {Jian Yang and Xukun Wang and Wentao Wang and Guoming Li and Qihang Fang and Ruihong Yuan and Tianyang Wang and Xiaomei Zhang and Yeying Jin and Zhaoxin Fan},
journal= {arXiv preprint arXiv:2410.00990},
year = {2025}
}