中文

SpeechMapper:面向LLM的语音到文本嵌入投影器

计算与语言 2026-02-05 v2

摘要

当前的语音LLM使用投影层将语音基础模型桥接到LLM,并在语音指令数据上训练所有这些组件。这种策略计算密集且容易受到任务和提示过拟合的影响。我们提出了SpeechMapper,一种经济高效的语音到LLM嵌入训练方法,可减轻过拟合,从而实现更鲁棒和更具泛化能力的模型。我们的模型首先在廉价硬件上无需LLM进行预训练,然后通过短暂的1K步指令微调阶段高效地附加到目标LLM上。通过语音翻译和口语问答的实验,我们展示了SpeechMapper预训练块的多功能性,呈现了任务无关的指令微调(一种基于ASR的适应策略,不在目标任务上训练)和任务特定的指令微调的结果。在任务无关的设置中,尽管从未在这些任务上训练过,SpeechMapper仍能与来自IWSLT25的最佳指令跟随语音LLM相媲美;而在任务特定的设置中,尽管需要更少的数据和计算,它在许多数据集上优于该模型。总体而言,SpeechMapper为无需大规模指令微调的高效、可泛化的语音-LLM集成提供了一种实用且可扩展的方法。

关键词

引用

@article{arxiv.2601.20417,
  title  = {SpeechMapper: Speech-to-text Embedding Projector for LLMs},
  author = {Biswesh Mohapatra and Marcely Zanon Boito and Ioan Calapodescu},
  journal= {arXiv preprint arXiv:2601.20417},
  year   = {2026}
}

备注

Accepted to ICASSP 2026