中文

基于扩散的无监督音视频语音增强

声音 2025-01-16 v2 人工智能 计算机视觉与模式识别 机器学习 音频与语音处理 信号处理

摘要

本文提出一种新的无监督音视频语音增强(AVSE)方法,将基于扩散的音视频语音生成模型与非负矩阵分解(NMF)噪声模型结合。首先,在干净语音条件下对应于相应视频数据的扩散模型进行预训练,以模拟语音生成分布。然后,将该预训练模型与基于 NMF 的噪声模型配对,用于迭代估计干净语音。具体而言,在逆扩散过程中实现基于扩散的后验采样方法,在每次迭代之后获得一个语音估计值,并用于更新噪声参数。实验结果确认,所提出的 AVSE 方法不仅优于其音频-only 对应物,而且比最新方法的无监督生成 AVSE 方法更具概括性。此外,新的推理算法在推理速度和性能之间提供了更好的平衡。代码和演示可在:https://jeaneudesayilo.github.io/fast_UdiffSE 获取。

关键词

引用

@article{arxiv.2410.05301,
  title  = {Diffusion-based Unsupervised Audio-visual Speech Enhancement},
  author = {Jean-Eudes Ayilo and Mostafa Sadeghi and Romain Serizel and Xavier Alameda-Pineda},
  journal= {arXiv preprint arXiv:2410.05301},
  year   = {2025}
}