中文

MOSA:简单适配器混合模型在基于大语言模型的多语言自动语音识别中优于单体方法

音频与语音处理 2026-02-05 v3

摘要

基于大语言模型(LLM)的自动语音识别(ASR)通过将语音表示投影到 LLM 空间以利用其强大的语义和推理能力,克服了多语言数据稀缺的问题。然而,尽管先前的方法通常通过扩展数据或模型参数来提升性能,但单个投影器往往难以有效对齐不同语言间的表示。在这项工作中,我们提出了一种基于混合专家(MoE)的投影器,名为 MOSA(简单适配器混合模型)。通过聚合多个简单适配器,该架构使不同的专家能够专注于学习语言共享或语言特定的知识。这种方法不仅减轻了语言间的参数干扰,还促进了从高资源语言到低资源语言的正向迁移,有效缓解了数据稀缺问题。实验结果表明,与 Ideal-LLM Base 相比,MOSA-Base 在平均词错误率(WER)上实现了 15.4% 的相对降低,并在所有语言上表现出一致的优越性。值得注意的是,MOSA 仅使用 Ideal-LLM Base 60% 的参数,就实现了 13.3% 的 WER 降低。这些发现突显了 MOSA 卓越的参数效率和对数据不平衡的鲁棒性,表明对于基于 LLM 的多语言 ASR,简单适配器的混合模型比复杂的单一适配器设计更为合适。

关键词

引用

@article{arxiv.2508.18998,
  title  = {MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR},
  author = {Junjie Li and Jing Peng and Yangui Fang and Shuai Wang and Kai Yu},
  journal= {arXiv preprint arXiv:2508.18998},
  year   = {2026}
}

备注

5 pages, 3 figures, accepted to ICASSP 2026