中文

大型音频-语言模型中扩展音频上下文以实现长篇理解

计算与语言 2026-01-22 v2 人工智能 声音 音频与语音处理

摘要

大型音频-语言模型 (LALMs) 常受限于短音频上下文窗口,即使其文本主干支持长上下文,这限制了长篇音频理解。先前工作在单模 LLM 上引入了上下文扩展方法 (如 YaRN),但其在 LALMs 中的应用尚未探索。首先,基于 RoPE 的上下文扩展,我们引入 Partial YaRN,这是一种训练免费、模态解耦的扩展方法,仅修改音频标记的位置,保持文本位置不变,以保留基础 LLM 的文本能力。其次,我们提出虚拟长篇音频训练 (VLAT),这是一种将 Partial YaRN 扩展到训练时位置增强的训练策略。VLAT 在训练期间模拟多样化的音频长度,从而实现对远超训练时所见长度的输入的泛化。我们的实验在 SALMONN 和 Qwen2-Audio 上表明,Partial YaRN 在广泛的设置下均优于原始模型,VLAT 在未见长度的长音频上提供了显著的性能提升。

关键词

引用

@article{arxiv.2510.15231,
  title  = {Extending Audio Context for Long-Form Understanding in Large Audio-Language Models},
  author = {Yuatyong Chaichana and Pittawat Taveekitworachai and Warit Sirichotedumrong and Potsawee Manakul and Kunat Pipatanakul},
  journal= {arXiv preprint arXiv:2510.15231},
  year   = {2026}
}

备注

EACL 2026. Code and dataset are available at: https://github.com/yophis/partial-yarn