词错误率是否是印度语言语音识别的良好评估指标?
计算与语言
2022-06-16 v3 音频与语音处理
摘要
我们提出了一种用于自动语音识别(ASR)中错误率计算的新方法。这一新指标适用于包含半字符且同一字符可有不同书写形式的语言。我们在印地语中实现了我们的方法,印地语是印度语境下的主要语言之一,我们认为该方法可扩展至其他具有大型字符集的类似语言。我们将指标称为替代词错误率(AWER)与替代字符错误率(ACER)。我们使用 wav2vec 2.0 为印度语言训练 ASR 模型。此外,我们使用语言模型来提升模型性能。我们的结果显示,在词级与字符级错误率分析上有显著改进,且 ASR 系统的可解释性在印地语中于 AWER 提升达 \%、ACER 提升达 \%。我们的实验表明,在具有复杂发音的语言中,存在多种不改变词义的书写单词方式。在此类情况下,AWER 与 ACER 作为指标将比 WER 与 CER 更有用。此外,我们开源了一个 21 小时的印地语新基准数据集及新指标脚本。
引用
@article{arxiv.2203.16601,
title = {Is Word Error Rate a good evaluation metric for Speech Recognition in Indic Languages?},
author = {Priyanshi Shah and Harveen Singh Chadha and Anirudh Gupta and Ankur Dhuriya and Neeraj Chhimwal and Rishabh Gaur and Vivek Raghavan},
journal= {arXiv preprint arXiv:2203.16601},
year = {2022}
}
备注
Need to upgrade the content completely