LipDiffuser:基于条件扩散模型的唇动到语音生成
音频与语音处理
2025-10-27 v3 声音
摘要
我们提出了 LipDiffuser,这是一种用于唇动到语音生成的条件扩散模型,可直接从无声视频记录中合成自然且清晰的语音。我们的方法利用保幅消融扩散模型 (MP-ADM) 架构作为去噪模型。为了有效地对模型进行条件化,我们结合了使用保幅特征线性调制 (MP-FiLM) 的视觉特征以及说话人嵌入。然后,神经声码器从生成的梅尔频谱图中重建语音波形。在 LRS3 数据集上的评估表明,LipDiffuser 在感知语音质量和说话人相似度方面优于现有的唇动到语音基线模型,同时在下游自动语音识别任务中保持竞争力。这些发现也得到了正式听力实验的支持。
引用
@article{arxiv.2505.11391,
title = {LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models},
author = {Julius Richter and Danilo de Oliveira and Tal Peer and Timo Gerkmann},
journal= {arXiv preprint arXiv:2505.11391},
year = {2025}
}