中文

训练自由音频标记压缩中的局部性很重要

计算与语言 2026-05-26 v1

摘要

音频语言模型(ALMs)正在被广泛用于音频描述、问答和开放式音频理解,但当音频输入表示为长前缀标记序列时,其推理成本仍然较高。这些音频前缀消耗上下文预算、增加内存使用,使得在资源受限或延迟敏感的设置中部署变得更加困难。现有的训练自由音频标记减少方法主要依赖固定池化或基于评分的剪枝。固定池化是内容不可感知的,而基于评分的剪枝可以保留孤立的显著标记,但会丢弃相邻的声学上下文。我们提出了局部时间双向合并(LTBM),一种训练自由的编码器空间压缩方法,在显式的时间窗口约束下合并相似的相邻音频标记。除了引入LTBM,我们使用受控的全局合并变体来隔离是否本身就是时间局部性对音频标记压缩是否有用的归纳偏置。在AudioCaps、Clotho和MMAU上使用Qwen2-Audio的实验表明,在多个压缩设置下,都存在任务依赖的局部性效应:局部性感知的合并在描述符任务中更有利,尤其是在更强的压缩下,而全局匹配在多选题音频理解中更具竞争力。在Audio Flamingo 3上的跨骨架验证进一步支持了在中等和激进压缩下,局部性感知的合并在描述任务方面具有优势。

关键词

引用

@article{arxiv.2605.25179,
  title  = {Locality Matters for Training-Free Audio Token Compression in Audio-Language Models},
  author = {Jiale Luo and Xiaoyu Liang and Haoji Hu},
  journal= {arXiv preprint arXiv:2605.25179},
  year   = {2026}
}

备注

Preprint. 8 pages main text, 10 pages total