中文

听诊器下的ASR:评估印度语言临床语音识别的偏差

计算与语言 2025-12-15 v1 声音 音频与语音处理

摘要

自动语音识别(ASR)越来越多地用于记录临床会诊,但其在多语言和人口结构多样的印度医疗环境中的可靠性仍大多尚不清楚。在本研究中,我们对涵盖Kannada、Hindi和印度英语的真实临床访谈数据上的ASR性能进行了首次系统性审计,比较了包括Indic Whisper、Whisper、Sarvam、Google speech to text、Gemma3n、Omnilingual、Vaani和Gemini在内的领先模型。我们评估了跨语言、说话人和人口子群的转录准确性,特别关注影响患者与临床医生之间以及基于性别或交叉差异的错误模式。我们的结果揭示了模型和语言之间的显著差异,一些系统在印度英语上表现具有竞争力,但在代码混合或方言语音上失败。我们还发现了与说话人角色和性别相关的系统性性能差距,引发了对临床环境中公平部署的担忧。通过提供全面的多语言基准和公平性分析,我们的工作强调了为印度医疗生态系统开发具有文化和人口结构包容性的ASR的必要性。

关键词

引用

@article{arxiv.2512.10967,
  title  = {ASR Under the Stethoscope: Evaluating Biases in Clinical Speech Recognition across Indian Languages},
  author = {Subham Kumar and Prakrithi Shivaprakash and Abhishek Manoharan and Astut Kurariya and Diptadhi Mukherjee and Lekhansh Shukla and Animesh Mukherjee and Prabhat Chand and Pratima Murthy},
  journal= {arXiv preprint arXiv:2512.10967},
  year   = {2025}
}