中文

通过提示感知音频编码器混合器增强语音大语言模型

音频与语音处理 2025-09-22 v3 声音

摘要

将音频编码器与大语言模型(LLM)连接,使LLM能够执行各种音频理解任务,如自动语音识别(ASR)和音频描述(AC)。大多数研究聚焦于训练适配器层以生成统一的音频特征。然而,不同任务可能需要强调语义或声学特征的特定特征,使得任务特定的音频特征更为理想。本文提出了提示感知混合(PaM)以增强语音LLM的方法,该方法使用多个音频编码器。我们的做法是根据指示不同任务的提示,使用不同专家提取不同特征。实验表明,仅凭PaM,一个语音LLM即可在ASR、说话人数量验证和AC任务上超越所有单编码器语音LLM的最佳性能。PaM也超越了其他特征融合基线,如拼接和平均。我们的代码将在:https://github.com/shanweiqiao/PaM 提供。

关键词

引用

@article{arxiv.2502.15178,
  title  = {Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders},
  author = {Weiqiao Shan and Yuang Li and Yuhao Zhang and Yingfeng Luo and Chen Xu and Xiaofeng Zhao and Long Meng and Yunfei Lu and Min Zhang and Hao Yang and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2502.15178},
  year   = {2025}
}

备注

16 pages,5 figures, 13 tables, to be published in EMNLP 2025 main conference