自动语音识别解决方案的准确度测量
机器学习
2026-04-27 v5 最优化与控制
摘要
对于听力受损或失聪 (DHH) 的人群来说,字幕是一种重要的可访问性工具。人工智能 (AI) 的显著发展使得自动语音识别 (ASR) 现在成为许多流行应用程序的一部分。这使得创建字幕变得容易且广泛可用——但转录需要达到高水平的准确率才能实现可访问性。科学出版物和行业报告称错误率很低,声称 AI 已达到人类水平甚至超越人工转录。与此同时,DHH 社区报告称 ASR 的准确性和可靠性存在严重问题。似乎在技术创新与依赖于转录的人群的真实生活经验之间存在差距。需要独立且全面的数据来捕捉 ASR 的当前状态。我们测量了十一种常见 ASR 服务的性能,这些服务使用更高教育讲座的录音。我们评估了技术条件(如流式传输、词汇表的使用以及语言之间的差异)的影响。我们的结果显示,各厂商之间以及单个音频样本之间的准确率差异很大。我们还测量了用于直播事件的流式 ASR 的显著较低质量。我们的研究表明,尽管最近的 ASR 改进了很多,但常见服务在准确性方面缺乏可靠性。
引用
@article{arxiv.2408.16286,
title = {Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form},
author = {Toshinori Kitamura and Tadashi Kozuno and Wataru Kumagai and Kenta Hoshino and Yohei Hosoe and Kazumi Kasaura and Masashi Hamaya and Paavo Parmas and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2408.16286},
year = {2026}
}
备注
This manuscript contains a technical error; the main result does not hold (see also arXiv:2604.21177 for a formal invalidation)