LPIPS-AttnWav2Lip:野外说话者生成的通用音频驱动唇部同步方法
声音
2026-02-03 v1 人工智能
多媒体
音频与语音处理
摘要
研究者表现出日益关注音频驱动的说话者头部生成。说话者生成的主要挑战在于实现唇部与音频之间的音视一致性,即唇部同步。本文提出了一种通用方法 LPIPS-AttnWav2Lip,用于基于音频重建任意说话者的面部图像。我们采用基于残差 CBAM 的 U-Net 架构,以更好地编码和融合音频与视觉信息。此外,语义对齐模块扩展了生成器网络的感受野,高效获取视觉特征的空间和通道信息;并匹配视觉特征的统计信息与音频潜向量,以实现音频内容信息对视觉信息的调整和注入。为实现精确的唇部同步和生成真实高质量图像,我们采用 LPIPS Loss,该损失函数模拟人类对图像质量的判断,减少训练过程中不稳定性的可能性。我们的方法在唇部同步准确性和视觉质量方面表现卓越,主观和客观评估结果均证明了这一点。论文的代码已提供如下链接:https://github.com/FelixChan9527/LPIPS-AttnWav2Lip
引用
@article{arxiv.2602.00189,
title = {LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild},
author = {Zhipeng Chen and Xinheng Wang and Lun Xie and Haijie Yuan and Hang Pan},
journal= {arXiv preprint arXiv:2602.00189},
year = {2026}
}
备注
This paper has been accepted by Elsevier's \textit{Speech Communication} journal. Official publication link: https://doi.org/10.1016/j.specom.2023.103028 The code for the paper is available at the following link: https://github.com/FelixChan9527/LPIPS-AttnWav2Lip