中文

可伸缩视觉 Transformer 的弹性注意力核心

计算机视觉与模式识别 2026-05-13 v1 机器学习

摘要

视觉 Transformer (ViT) 通过利用全连接自注意力实现强大的数据驱动扩展,但这种灵活性导致计算成本随图像分辨率呈二次方增长,限制了 ViT 在高分辨率领域的应用。其背后的假设是成对的 token 交互是学习丰富视觉语义表征所必需的。本文挑战了这一假设,表明无需直接 patch-to-patch 交互即可学习有效的视觉表征。我们提出 VECA (Visual Elastic Core Attention),一种视觉转换器架构,使用由小型已学习核心组成的高效线性时间核心-外围结构注意力。 在 VECA 中,这些核心充当通信接口:patch token 仅通过核心 token 交换信息,这些核心从头初始化并在各层中传递。由于 N 个图像 patch 只与一个保持分辨率不变的 C 个已学习“核心”嵌入直接相互作用,这导致对固定 C 的线性复杂度 O(N),绕过了二次方规模。与先前的跨注意力架构相比,VECA 保持并迭代更新完整的 N 个输入 token,避免了小 C 瓶颈。结合核心轴上的嵌套训练,本模型可以在推理期间弹性地在计算和精度之间进行权衡。在分类和稠密任务上,VECA 实现了与最新视觉基础模型相竞争的性能,同时降低了计算成本。我们的结果表明,弹性核心-外围注意力是视觉 Transformer 可扩展替代建模块。

关键词

引用

@article{arxiv.2605.12491,
  title  = {Elastic Attention Cores for Scalable Vision Transformers},
  author = {Alan Z. Song and Yinjie Chen and Mu Nan and Rui Zhang and Jiahang Cao and Weijian Mai and Muquan Yu and Hossein Adeli and Deva Ramanan and Michael J. Tarr and Andrew F. Luo},
  journal= {arXiv preprint arXiv:2605.12491},
  year   = {2026}
}

备注

Project repository here: https://github.com/alansong1322/VECA