面向低资源语言自动语音识别的多模态上下文学习
计算与语言
2026-04-21 v2 人工智能
摘要
自动语音识别(ASR)目前仅覆盖世界语言的一小部分,这主要归因于有监督数据的稀缺。基于大语言模型(LLM)的上下文学习(ICL)解决了这一问题,但先前的工作主要关注训练期间覆盖的高资源语言和纯文本设置。本文研究语音大语言模型能否通过多模态上下文学习(MICL)学习未见过的语言,以及如何利用这种学习来改进自动语音识别。我们使用两个语音大语言模型 Phi-4 和 Qwen3-Omni,在三种不同的濒危语言上进行了实验。首先,我们发现 MICL 利用语音和文本两种模态,对未见过的语言是有效的。我们进一步表明,跨语言迁移学习提高了 MICL 在目标语言上的效率,而无需在这些语言上进行训练。此外,我们分析了注意力模式以解释 MICL 机制,观察到音频和文本上下文之间存在依赖于层的偏好,且整体偏向于文本。最后,我们表明,基于提示的语音大模型自动语音识别在未见过的语言上表现不佳,这促使我们构建了一个简单的自动语音识别系统,该系统通过基于 MICL 的声学假设选择,将更强的声学模型与语音大模型相结合。结果表明,MICL 持续提升了自动语音识别性能,并且跨语言迁移学习在不使用目标语言数据的情况下,匹配或优于基于语料库训练的语言模型。我们的代码已公开。
引用
@article{arxiv.2601.05707,
title = {Multimodal In-context Learning for ASR of Low-resource Languages},
author = {Zhaolin Li and Jan Niehues},
journal= {arXiv preprint arXiv:2601.05707},
year = {2026}
}
备注
ACL 2026 findings