中文

PAL: 通过 LLM 探测音频编码器——音频信息向 LLM 的传递

声音 2026-02-03 v3 人工智能 计算与语言 音频与语音处理

摘要

将音频感知集成到大型语言模型(LLM)中是实现机器听觉应用的新兴研究领域,但音频编码器与 LLM 之间丰富音频语义的高效传递仍未被充分探索。最广泛使用的集成范式将音频编码器输出令牌投影到 LLM 输入空间(例如通过 MLP 或 Q-Former),然后将其插入或前置到文本令牌序列中。我们将这种通用方案称为前置到 LLM 输入令牌空间(PLITS)集成。我们提出一种高效的替代方案——轻量级音频 LLM 集成(LAL)。LAL 仅通过 LLM 选定层中的注意力机制注入音频表示,绕过前馈模块。它在适当的抽象层次上编码丰富的音频语义,以集成到不同的 transformer 块中,与现有方法相比大幅降低计算开销。我们进一步提出 PAL,一种通过 LLM 高效探测音频编码器的混合集成方法。PAL 仅对一组紧凑的摘要令牌应用 PLITS,同时通过 LAL 集成完整的音频令牌序列。在相同的训练方案下,LAL 在多个基础 LLM 和任务上始终匹配或超越现有集成方法,相比强大的 PLITS 基线性能提升高达 30%,同时减少约 60% 的内存使用并提高约 190% 的吞吐量。此外,PAL 在保持显著更好的计算和内存效率的同时,匹配或超越了 PLITS 的性能。

关键词

引用

@article{arxiv.2506.10423,
  title  = {PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs},
  author = {Tony Alex and Wish Suharitdamrong and Sara Atito and Armin Mustafa and Philip J. B. Jackson and Imran Razzak and Muhammad Awais},
  journal= {arXiv preprint arXiv:2506.10423},
  year   = {2026}
}

备注

20 pages, 7 figures