中文

精简数据 curated 才是扩展语音增强的关键

音频与语音处理 2025-08-20 v2 声音

摘要

现代大多数语音增强系统都依赖于数据驱动的神经网络模型。传统观念认为更大的数据集会导致更好的模型性能,这一观点在其他诸多任务中都得到了经验验证。然而,近期研究揭示了在扩大语音增强数据时会出现报酬递减。我们聚焦于一个关键因素:大规模数据集中普遍存在的“干净”训练标签质量问题。本工作重新审视了这一现象,证明在大规模训练集中,优先考虑高质量训练数据比单纯扩大数据量更为重要。实验发现,在精心挑选的700小时数据集上训练的模型,可以超越在2500小时完整数据集上训练的模型。这一结果凸显了在有效扩展语音增强系统时,数据 curated 起着至关重要的作用。

关键词

引用

@article{arxiv.2506.23859,
  title  = {Less is More: Data Curation Matters in Scaling Speech Enhancement},
  author = {Chenda Li and Wangyou Zhang and Wei Wang and Robin Scheibler and Kohei Saijo and Samuele Cornell and Yihui Fu and Marvin Sach and Zhaoheng Ni and Anurag Kumar and Tim Fingscheidt and Shinji Watanabe and Yanmin Qian},
  journal= {arXiv preprint arXiv:2506.23859},
  year   = {2025}
}

备注

Accepted by ASRU2025