中文

从 URGENT 2024 语音增强挑战赛中汲取的经验

音频与语音处理 2025-06-03 v1 声音 信号处理

摘要

URGENT 2024 挑战赛旨在促进具有高度普适性、鲁棒性和泛化性的语音增强(SE)技术,其特点在于更广泛的任务定义、大规模多领域数据以及全面的评估指标。受挑战赛成果的启发,本文对 SE 系统开发中两个关键但研究不足的问题进行了深入分析:数据清洗和评估指标。我们强调了传统 SE 流程中被忽视的几个问题:(1)声明音频带宽与实际音频带宽之间的不匹配,甚至在各种“高质量”语音语料库中也存在标签噪声;(2)缺乏既能克服最困难条件(如语音重叠、强噪声/混响)的有效 SE 系统,也缺乏可靠的语音样本难度度量;(3)结合多方面指标进行全面评估的重要性,该评估与人类判断具有良好的相关性。我们希望这一努力能够启发未来改进的 SE 流程设计。

关键词

引用

@article{arxiv.2506.01611,
  title  = {Lessons Learned from the URGENT 2024 Speech Enhancement Challenge},
  author = {Wangyou Zhang and Kohei Saijo and Samuele Cornell and Robin Scheibler and Chenda Li and Zhaoheng Ni and Anurag Kumar and Marvin Sach and Wei Wang and Yihui Fu and Shinji Watanabe and Tim Fingscheidt and Yanmin Qian},
  journal= {arXiv preprint arXiv:2506.01611},
  year   = {2025}
}

备注

5 pages, 4 figures, 1 table. Accepted by Interspeech 2025. Code available at https://github.com/urgent-challenge/urgent2024_analysis