中文

AlignFormer:通过模态匹配实现更好的零样指令跟随语音-LLM

音频与语音处理 2025-07-08 v2

摘要

将语音集成到 LLM(语音-LLM)最近日益受到关注。主流方案是连接训练良好的语音编码器与 LLM 之间通过神经适配器。然而,语音序列与文本序列长度不匹配的问题尚未得到良好处理,导致语音与文本之间模态匹配不完美。本文提出一种新型神经适配器AlignFormer,通过CTC和动态窗口QFormer层来缩小两种模态的长度差。其中,CTC对齐提供了QFormer的动态窗口信息。LLM背板在训练时保持冻结,以保留其文本能力,尤其是指令跟随能力。仅使用ASR数据进行训练时,提出的AlignFormer能够为语音-LLM解锁指令跟随能力,使模型能够执行零样语音翻译(ST)和语音问答(SQA)任务。事实上,语音-LLM配合AlignFormer理论上可以完成LLM背板在语音版本中能处理的任何任务。为评估指令跟随语音-LLM的效果,我们提出使用指令跟随率(IFR)进行评估,并提供了系统化的IFR评估视角。此外,我们发现音频在训练中的位置会影响语音-LLM的指令跟随能力,并对其进行深入研究。我们的发现表明,音频优先训练比指令优先训练实现更高的IFR。AlignFormer在音频优先训练下可实现接近100%的IFR,并在某些评估数据上实现从零到非零IFR的突破性提升。我们认为本研究是通往LLM嵌入空间中完美语音与文本模态匹配的重要一步。

关键词

引用

@article{arxiv.2412.01145,
  title  = {AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM},
  author = {Ruchao Fan and Bo Ren and Yuxuan Hu and Rui Zhao and Shujie Liu and Jinyu Li},
  journal= {arXiv preprint arXiv:2412.01145},
  year   = {2025}
}

备注

To be published in the Journal of Selected Topics in Signal Processing (JSTSP)