太虚构:现代自动语音识别用于语音增强评估的研究
音频与语音处理
2026-05-13 v1
摘要
语音增强(SE)系统通常使用多种仪器指标进行评估。将自动语音识别(ASR)系统用于评估 SE 性能的做法在文献中常见,通常以词错误率(WER)表示。然而,WER 分数严重依赖所选 ASR 系统和文本规范化管道的选择。本文我们考察现代 ASR 模型与增强语音的人类识别之间的相关性。听觉实验表明,带有大规模噪声训练和嵌入式语言模型的现代 ASR 模型与人类 WER 的相关性更高,而简单模型则较弱,转折模型提供了最可靠的转录结果。然而,我们也表明,这些模型对噪声的鲁棒性以及上下文的使用在以声学为导向的增强性能评估方面可能并不信息丰富。
引用
@article{arxiv.2605.12107,
title = {Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement},
author = {Danilo de Oliveira and Tal Peer and Timo Gerkmann},
journal= {arXiv preprint arXiv:2605.12107},
year = {2026}
}