中文

具噪声鲁棒性的语音分离与快速生成式纠正

音频与语音处理 2024-06-12 v1

摘要

语音分离是从混合音频信号中隔离多个语音源的任务,在噪声环境中仍具有挑战性。本文提出一种生成式纠正方法,以增强判别式分离器的输出。通过利用基于扩散模型的生成式纠正器,我们 refined 混合语音的分离过程,通过去除噪声和感知上不自然的失真。此外,我们使用预测损失优化生成模型,将扩散模型的逆过程压缩为单一步骤,并通过逆过程纠正任何相关误差。我们的方法在 Libri2Mix 噪声数据集上实现了领先的性能,并在多种噪声下的 WSJ 数据集上表现出色,相对于 SepFormer 提升 SI-SNR 约 22-35%,显示出鲁棒性和强大的泛化能力。

关键词

引用

@article{arxiv.2406.07461,
  title  = {Noise-robust Speech Separation with Fast Generative Correction},
  author = {Helin Wang and Jesus Villalba and Laureano Moro-Velazquez and Jiarui Hai and Thomas Thebaud and Najim Dehak},
  journal= {arXiv preprint arXiv:2406.07461},
  year   = {2024}
}

备注

Accepted at INTERSPEECH 2024