面向印度语言语音识别系统的正字法导向评估
计算与语言
2026-03-03 v1 声音
摘要
评估印度语言语音识别系统存在挑战,因拼写变体、后缀分割灵活性以及代码混合单词中的非标准拼写。传统的词错误率(WER)往往比人类用户感知的系统性能更悲观。更贴近实际应用的评估需要捕捉可接受的正字法变体,但这在资源匮乏的印度语言上极具挑战性。本文利用最近的大语言模型(Large Language Model, LLM)技术,我们提出了一种创建捕捉可接受变体基准的框架。通过大量实验,我们展示,OIWER通过考虑正字法变体,减少了悲观的错误率(平均改进6.3分),缩小了模型间虚高的差距(例如Gemini-Canary性能差距从18.1降至11.5分),并比先前方法如WER-SN在人类感知方面更贴近实际(提升4.9分)。
引用
@article{arxiv.2603.00941,
title = {Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages},
author = {Kaushal Santosh Bhogale and Tahir Javed and Greeshma Susan John and Dhruv Rathi and Akshayasree Padmanaban and Niharika Parasa and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:2603.00941},
year = {2026}
}
备注
Accepted in ICASSP 2026