中文

“抱歉,我没听清”:语音模型如何错失最重要的内容

人工智能 2026-02-18 v2 计算与语言 计算机与社会

摘要

尽管语音识别系统在标准基准测试上实现了低词错误率,但在实际部署中,它们常常在简短、高风险的话语上失败。在这里,我们研究了一个高风险任务中的这种失败模式:转录美国参与者所说的美国街道名称。我们评估了来自OpenAI、Deepgram、Google和Microsoft的15个模型,这些模型基于语言多样化的美国说话者的录音,发现平均转录错误率为44%。我们通过地理位置量化了失败转录的下游影响,并表明错误转录对所有说话者都会造成系统性错误,但对于非英语母语者,路由距离误差是英语母语者的两倍。为了减轻这种危害,我们引入了一种合成数据生成方法,该方法使用开源文本到语音模型生成命名实体的多样化发音。使用少于1,000个合成样本进行微调,使非英语母语者的街道名称转录准确率提高了近60%(相对于基础模型)。我们的结果凸显了语音系统中基准性能与现实世界可靠性之间的关键差距,并展示了一条减少高风险转录错误的简单、可扩展的路径。

关键词

引用

@article{arxiv.2602.12249,
  title  = {"Sorry, I Didn't Catch That": How Speech Models Miss What Matters Most},
  author = {Kaitlyn Zhou and Martijn Bartelds and Federico Bianchi and James Zou},
  journal= {arXiv preprint arXiv:2602.12249},
  year   = {2026}
}

备注

Preprint