中文

面向 Vision Transformer 的表征注意力

计算机视觉与模式识别 2026-05-15 v1

摘要

线性注意力已成为将 Vision Transformer 扩展至超越密集自注意力二次方成本的一个有前景的方向。一种普遍策略是将空间 token 压缩为一组紧凑的中间代理,以介导全局信息交换。然而,现有方法通常从预定义的空间布局中导出这些代理 token,导致 token 压缩仍锚定于图像坐标,而非视觉内容的语义组织。为克服这一局限,我们提出了表征注意力(Representative Attention, RPAttention),一种直接在表征空间中执行 token 压缩的线性全局注意力机制。它不从固定的空间分区构建中间 token,而是遵循轻量级的 Gather-Interact-Distribute 范式,动态形成一组紧凑的、学习到的代表性 token,以使语义相关的区域能够无视其空间距离进行通信。空间 token 首先通过基于竞争性相似度的路由被软收集到代表性 token 中。随后,这些代表性 token 在紧凑的潜在空间内执行全局交互,最后通过查询驱动的交叉注意力将精炼后的信息广播回所有空间 token。通过用表征驱动的压缩替代坐标驱动的聚合,RPAttention 保留了全局感受野,同时自适应地将 token 通信与每个输入的内容结构对齐。RPAttention 将主导性的 token 交互复杂度相对于空间 token 数量从二次方降低至线性缩放,同时保持了富有表现力的全局上下文建模。在多种 Vision Transformer 主干上针对图像分类、目标检测和语义分割的大量实验证明了我们设计的有效性。

关键词

引用

@article{arxiv.2605.14913,
  title  = {Representative Attention For Vision Transformers},
  author = {Yuntong Li and Hainuo Wang and Hengxing Liu and Mingjia Li and Xiaojie Guo},
  journal= {arXiv preprint arXiv:2605.14913},
  year   = {2026}
}