面向多语言指令-following 语音 LLM 的语言感知蒸馏与 ASR-only 监督
计算与语言
2026-03-10 v1
摘要
能够理解并遵循多语言指令的语音大型语言模型(Speech LLMs)对于现实世界交互非常有用,但由于需要大规模的、特定于任务的语音语料库,训练过程困难。虽然最近的蒸馏方法仅使用标注的 ASR 数据,通过轻量级投影器对齐文本与语音,能够训练出性能较好的英语-only Speech LLMs,但在扩展到多语言场景时,由于共享投影器中的语言干扰,这些模型表现不佳。我们通过引入语言感知蒸馏,使用查询库和门控网络,通过 Q-Former 投影器选择或混合查询标记,来解决这一问题。我们的方法在指令遵循方面相较于匹配的多语言蒸馏基线提升了 14%。我们进一步合成了 Audio-MLQA,这是一个基于 MLQA 构建的多语言 spoken QA 基准数据集,包含高质量的 TTS 问题。我们的最佳模型在 Audio-MLQA 上的性能相较于现有的 Speech LLM 基线提升了 32%。
引用
@article{arxiv.2603.07025,
title = {Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision},
author = {Shreyas Gopal and Donghang Wu and Ashutosh Anshul and Yeo Yue Heng and Yizhou Peng and Haoyang Li and Hexin Liu and Eng Siong Chng},
journal= {arXiv preprint arXiv:2603.07025},
year = {2026}
}
备注
Submitted for Review to Interspeech 2026