中文

去噪会伤害:对现代医学自动语音识别系统语音增强效果的系统性研究

声音 2025-12-22 v1 人工智能 机器学习 音频与语音处理

摘要

语音增强方法通常被认为可以提高自动语音识别(ASR)在噪声环境下的性能。然而,在训练于多样化噪声数据的现代大规模 ASR 模型情况下,这些技术的有效性无法 garantire。我们对 MetricGAN-plus-voicebank 去噪对四款最先进的 ASR 系统(OpenAI Whisper、NVIDIA Parakeet、Google Gemini Flash 2.0、Parrotlet-a)进行系统性评估,使用 500 份医学语音录音,测试 9 种噪声条件。通过语义 WER(semWER)——一种归一化词错误率(WER)指标,衡量 ASR 性能。我们的结果揭示了一种反直觉发现:语音增强预处理会在所有噪声条件和模型下降低 ASR 性能。原始噪声音频在所有 40 种配置(4 个模型 × 10 种条件)中均实现更低的 semWER,降幅从 1.1% 到 46.6% 不等。这些发现表明,现代 ASR 模型已具备足够的内部鲁棒性,而传统语音增强可能会移除 ASR 所需的声学特征。对于在噪声临床环境中部署医学语音记录系统的实践者而言,本研究结果表明,对音频进行降噪处理可能不仅计算资源浪费,还可能损害转录准确性。

关键词

引用

@article{arxiv.2512.17562,
  title  = {When De-noising Hurts: A Systematic Study of Speech Enhancement Effects on Modern Medical ASR Systems},
  author = {Sujal Chondhekar and Vasanth Murukuri and Rushabh Vasani and Sanika Goyal and Rajshree Badami and Anushree Rana and Sanjana SN and Karthik Pandia and Sulabh Katiyar and Neha Jagadeesh and Sankalp Gulati},
  journal= {arXiv preprint arXiv:2512.17562},
  year   = {2025}
}

备注

Technical Report