印度语言在农业情境下的自动语音识别基准测试
音频与语音处理
2026-02-09 v2 人工智能
计算与语言
声音
摘要
印度农业咨询服务的数字化化需要能够准确转录多语言中特定领域术语的鲁棒自动语音识别 (ASR) 系统。本文提出了用于评估印度语农业语境下 ASR 性能的基准框架,涵盖印地语、泰卢固语和奥利亚语。我们引入包括农业加权词错误率 (AWWER) 和领域特定实用性评分等评估指标,以补充传统指标。对 10,934 段音频录音的评估显示,不同语言和模型之间存在性能差异,印地语整体表现最佳(WER: 16.2%),而奥利亚语则 presents 最大挑战(最佳 WER: 35.1%,仅通过说话人分割实现)。我们刻画了农业现场录音中固有的音频质量挑战,证明说话人分割结合最佳说话人选择可显著降低多说话人录音的 WER(取决于多说话人音频比例,降低幅度可达 66%)。我们识别出农业术语中的常见错误模式,提供实用建议以改进低资源农业领域的 ASR 系统。该研究为未来农业 ASR 开发建立了基准。
引用
@article{arxiv.2602.03868,
title = {Benchmarking Automatic Speech Recognition for Indian Languages in Agricultural Contexts},
author = {Chandrashekar M S and Vineet Singh and Lakshmi Pedapudi},
journal= {arXiv preprint arXiv:2602.03868},
year = {2026}
}
备注
9 pages, 6 figures