基于扩散的无监督音视频语音增强
声音
2025-01-16 v2 人工智能
计算机视觉与模式识别
机器学习
音频与语音处理
信号处理
摘要
本文提出一种新的无监督音视频语音增强(AVSE)方法,将基于扩散的音视频语音生成模型与非负矩阵分解(NMF)噪声模型结合。首先,在干净语音条件下对应于相应视频数据的扩散模型进行预训练,以模拟语音生成分布。然后,将该预训练模型与基于 NMF 的噪声模型配对,用于迭代估计干净语音。具体而言,在逆扩散过程中实现基于扩散的后验采样方法,在每次迭代之后获得一个语音估计值,并用于更新噪声参数。实验结果确认,所提出的 AVSE 方法不仅优于其音频-only 对应物,而且比最新方法的无监督生成 AVSE 方法更具概括性。此外,新的推理算法在推理速度和性能之间提供了更好的平衡。代码和演示可在:https://jeaneudesayilo.github.io/fast_UdiffSE 获取。
引用
@article{arxiv.2410.05301,
title = {Diffusion-based Unsupervised Audio-visual Speech Enhancement},
author = {Jean-Eudes Ayilo and Mostafa Sadeghi and Romain Serizel and Xavier Alameda-Pineda},
journal= {arXiv preprint arXiv:2410.05301},
year = {2025}
}