大型音频-语言模型中扩展音频上下文以实现长篇理解
计算与语言
2026-01-22 v2 人工智能
声音
音频与语音处理
摘要
大型音频-语言模型 (LALMs) 常受限于短音频上下文窗口,即使其文本主干支持长上下文,这限制了长篇音频理解。先前工作在单模 LLM 上引入了上下文扩展方法 (如 YaRN),但其在 LALMs 中的应用尚未探索。首先,基于 RoPE 的上下文扩展,我们引入 Partial YaRN,这是一种训练免费、模态解耦的扩展方法,仅修改音频标记的位置,保持文本位置不变,以保留基础 LLM 的文本能力。其次,我们提出虚拟长篇音频训练 (VLAT),这是一种将 Partial YaRN 扩展到训练时位置增强的训练策略。VLAT 在训练期间模拟多样化的音频长度,从而实现对远超训练时所见长度的输入的泛化。我们的实验在 SALMONN 和 Qwen2-Audio 上表明,Partial YaRN 在广泛的设置下均优于原始模型,VLAT 在未见长度的长音频上提供了显著的性能提升。
关键词
引用
@article{arxiv.2510.15231,
title = {Extending Audio Context for Long-Form Understanding in Large Audio-Language Models},
author = {Yuatyong Chaichana and Pittawat Taveekitworachai and Warit Sirichotedumrong and Potsawee Manakul and Kunat Pipatanakul},
journal= {arXiv preprint arXiv:2510.15231},
year = {2026}
}
备注
EACL 2026. Code and dataset are available at: https://github.com/yophis/partial-yarn