Speech Robust Bench:语音识别鲁棒性基准测试
音频与语音处理
2024-12-10 v3 计算与语言
机器学习
声音
摘要
随着自动语音识别(ASR)模型变得越来越普及,确保它们在物理和数字世界中存在的损坏下做出可靠的预测至关重要。我们提出了 Speech Robust Bench(SRB),这是一个用于评估 ASR 模型对各种损坏鲁棒性的综合基准测试。SRB 由 114 种输入扰动组成,模拟了 ASR 模型在真实环境中部署时可能遇到的异构损坏范围。我们使用 SRB 评估了多个最先进的 ASR 模型的鲁棒性,并观察到模型大小以及某些建模选择(如使用离散表示或自训练)似乎有助于提高鲁棒性。我们将此分析扩展到测量 ASR 模型在不同人口统计亚群(即英语和西班牙语使用者,以及男性和女性)数据上的鲁棒性。我们的结果揭示了模型鲁棒性在不同亚群之间存在显著差异。我们相信,SRB 将通过使全面且可比较的鲁棒性评估更容易进行,从而显著促进未来针对鲁棒 ASR 模型的研究。
引用
@article{arxiv.2403.07937,
title = {Speech Robust Bench: A Robustness Benchmark For Speech Recognition},
author = {Muhammad A. Shah and David Solans Noguero and Mikko A. Heikkila and Bhiksha Raj and Nicolas Kourtellis},
journal= {arXiv preprint arXiv:2403.07937},
year = {2024}
}
备注
submitted to NeurIPS datasets and benchmark track 2025