LoASR-Bench:评估面向低资源语音识别的大型语音语言模型
计算与语言
2026-03-23 v1 人工智能
摘要
大型语言模型 (LLM) 推动了语音语言模型 (SpeechLM) 的显著进展,在高资源条件下的自动语音识别 (ASR) 中表现出强大的性能。然而,现有基准主要关注高资源语言, insufficiently 理解 SpeechLM 在低资源语言上的 ASR 行为。这一差距至关重要,因为实际的 ASR 系统必须可靠地支持低资源语言并在不同语言家族间具有良好的泛化能力,直接阻碍了基于 SpeechLM 的 ASR 在现实多语言场景中的部署。因此,必须评估 SpeechLM 在低资源语言上的表现,以确保其在不同语言家族间的可泛化性。为此,我们提出了 LoASR-Bench,一个综合性基准,旨在评估最新 SpeechLM 在 diverse 语言家族中 low-resource automatic speech recognition (ASR) 的表现。LoASR-Bench 包含来自 9 个语言家族的 25 种语言,涵盖拉丁字母和非拉丁字母脚本,使其能够进行跨语言和跨脚本的 ASR 性能评估。实验结果突显了最新 SpeechLM 在处理真实低资源语言方面的局限性。
引用
@article{arxiv.2603.20042,
title = {LoASR-Bench: Evaluating Large Speech Language Models on Low-Resource Automatic Speech Recognition Across Language Families},
author = {Jianan Chen and Xiaoxue Gao and Tatsuya Kawahara and Nancy F. Chen},
journal= {arXiv preprint arXiv:2603.20042},
year = {2026}
}