非洲语言多语言语音识别的语言学信息化评估
计算与语言
2026-02-05 v1
摘要
词错误率(WER)通过将语音学、声调及其他语言学错误合并为单个词汇错误,无法准确表征非洲语言ASR模型的性能。相比之下,特征错误率(FER)最近受到关注,被视为揭示模型性能中语言学意义错误的可行指标。本文我们在两种非洲语言上评估三个语音编码器,通过补充WER、CER和FER,并加入面向声调的扩展(TER)。我们表明,基于语音学特征计算的FER和TER即使在词级准确率较低时,也揭示了语言学显著性的错误模式。我们的结果显示,模型在段特征上表现更好,而声调(特别是中调和降调)是最具挑战性的特征。乌尔巴哈(Yoruba)的实验结果显示,指标之间存在显著差异,WER=0.788,CER=0.305,FER=0.151。同样对于乌内梅(一种缺乏预训练数据且濒危的语言),一个在总体WER几乎为零且CER为0.461的模型实现了相对较低的FER为0.267。这表明模型的错误往往可归因于单个语音特征错误,而这种现象被像WER这样的全有或全无指标所掩盖。
引用
@article{arxiv.2602.04716,
title = {Linguistically Informed Evaluation of Multilingual ASR for African Languages},
author = {Fei-Yueh Chen and Lateef Adeleke and C. M. Downey},
journal= {arXiv preprint arXiv:2602.04716},
year = {2026}
}
备注
To appear at AfricaNLP 2026