具噪声鲁棒性的语音分离与快速生成式纠正
音频与语音处理
2024-06-12 v1
摘要
语音分离是从混合音频信号中隔离多个语音源的任务,在噪声环境中仍具有挑战性。本文提出一种生成式纠正方法,以增强判别式分离器的输出。通过利用基于扩散模型的生成式纠正器,我们 refined 混合语音的分离过程,通过去除噪声和感知上不自然的失真。此外,我们使用预测损失优化生成模型,将扩散模型的逆过程压缩为单一步骤,并通过逆过程纠正任何相关误差。我们的方法在 Libri2Mix 噪声数据集上实现了领先的性能,并在多种噪声下的 WSJ 数据集上表现出色,相对于 SepFormer 提升 SI-SNR 约 22-35%,显示出鲁棒性和强大的泛化能力。
引用
@article{arxiv.2406.07461,
title = {Noise-robust Speech Separation with Fast Generative Correction},
author = {Helin Wang and Jesus Villalba and Laureano Moro-Velazquez and Jiarui Hai and Thomas Thebaud and Najim Dehak},
journal= {arXiv preprint arXiv:2406.07461},
year = {2024}
}
备注
Accepted at INTERSPEECH 2024