中文

面向印度语言语音识别系统的正字法导向评估

计算与语言 2026-03-03 v1 声音

摘要

评估印度语言语音识别系统存在挑战,因拼写变体、后缀分割灵活性以及代码混合单词中的非标准拼写。传统的词错误率(WER)往往比人类用户感知的系统性能更悲观。更贴近实际应用的评估需要捕捉可接受的正字法变体,但这在资源匮乏的印度语言上极具挑战性。本文利用最近的大语言模型(Large Language Model, LLM)技术,我们提出了一种创建捕捉可接受变体基准的框架。通过大量实验,我们展示,OIWER通过考虑正字法变体,减少了悲观的错误率(平均改进6.3分),缩小了模型间虚高的差距(例如Gemini-Canary性能差距从18.1降至11.5分),并比先前方法如WER-SN在人类感知方面更贴近实际(提升4.9分)。

关键词

引用

@article{arxiv.2603.00941,
  title  = {Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages},
  author = {Kaushal Santosh Bhogale and Tahir Javed and Greeshma Susan John and Dhruv Rathi and Akshayasree Padmanaban and Niharika Parasa and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2603.00941},
  year   = {2026}
}

备注

Accepted in ICASSP 2026