分析衡量 Omni-LLMs 解码策略的注意力汇聚本质
计算机视觉与模式识别
2026-05-08 v2
摘要
本文旨在无需额外训练的情况下强化 Omnimodal Large Language Models(Omni-LLMs)在推理阶段的推理能力。这些模型同时处理视频、音频和文本,鉴于其消耗的大量 token,注意力在其间的路由方式是其行为的核心因素。我们特别关注注意力汇聚(attention sinks),即无论其语义内容如何,都会消耗大量注意力的 token,以了解这种路由如何展开。为此,我们对 Omni-LLMs 中的汇聚行为进行系统性分析。我们的分析得出两个关键发现:(i)高汇聚注意力并不仅仅指示注意力头的冗余,表明汇聚值表示在发挥额外的功能性作用;(ii)汇聚值向量充当被添加到每个 token 输出中的共享偏置,作为一种全局信号,用于组织整体表示。基于此,我们提出了 OutRo,通过相应地将非汇聚 token 的表示与汇聚在特征空间中对齐,并放宽汇聚 token 在早期层的因果掩码,以在其余解码进行之前锐化此偏置。该设计无需额外的前向传递或访问注意力图即可提升推理过程。基于广泛的实验,OutRo 在七个视频问答基准测试中 consistently 提升性能,并展现出强大的泛化能力,同时仅增加 1.1 倍的解码开销。
引用
@article{arxiv.2603.14337,
title = {On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs},
author = {Suho Yoo and Youngjoon Jang and Joon Son Chung},
journal= {arXiv preprint arXiv:2603.14337},
year = {2026}
}
备注
Preprint