大语言模型能否可靠地纠正低资源 ASR 中的错误?一项针对西弗里斯兰语的污染感知案例研究
计算与语言
2026-05-20 v1
摘要
自动语音识别(ASR)近年来取得了显著进步,但在低资源语言上的性能仍然有限。大语言模型(LLMs)通过生成式纠错(GER)显示出改进 ASR 的潜力,但其在低资源环境下的有效性仍未得到充分探索。此外,数据污染在多大程度上影响了基于 LLM 的 GER 所报告的改进,这一点仍不清楚。本研究调查了针对低资源语言弗里西语的基于 LLM 的 GER。除了公开语料库外,我们还构建并使用了一个包含非公开文本的弗里西语离线数据集进行评估,以控制潜在的数据污染。结果表明,GER 在大多数设置下都能提高 ASR 性能,其中最佳的 GPT-5.1 结果超过了 Oracle 词错误率(WER)。在离线数据集上取得的可比增益表明,这些改进反映了真实的纠错能力。我们进一步提供了详细的错误分析,揭示了模型的纠错模式。
引用
@article{arxiv.2605.19711,
title = {Can Large Language Models Reliably Correct Errors in Low-Resource ASR? A Contamination-Aware Case Study on West Frisian},
author = {Yun Hao and Reihaneh Amooie and Wietse de Vries and Rik van Noord and Martijn Wieling},
journal= {arXiv preprint arXiv:2605.19711},
year = {2026}
}
备注
Submitted to Interspeech 2026