中文

AnchorFormer:高效视觉变换器的可微锚定注意力

计算机视觉与模式识别 2025-06-23 v3 机器学习

摘要

最近,视觉变换器 (ViT) 通过衡量图像块之间的全局自注意力在视觉任务上取得了优异性能。给定 nn 个图像块,它们将具有二次复杂度,即 O(n2)\mathcal{O}(n^2),当以小颗粒度分割输入图像时,计算成本较高。同时,关键信息通常随机分布在输入图像的少数区域,一些 token 可能对下游任务无帮助。为处理此问题,我们引入一种基于锚点的高效视觉变换器 (AnchorFormer),其中采用锚 token 来学习关键信息并加速推理。首先,通过估计锚和 token 之间的二分注意力,复杂度将从 O(n2)\mathcal{O}(n^2) 降低到 O(mn)\mathcal{O}(mn),其中 mm 为锚的数量且 m<nm < n。值得注意的是,通过将锚表示为神经网络层中的神经元,我们可以对这些锚进行可微学习,并通过马尔可夫过程近似全局自注意力。这避免了非可微操作带来的负担,并进一步加快了近似注意力速度。此外,我们将该模型扩展到包括分类、检测和分割三个下游任务。广泛的实验表明,AnchorFormer 的有效性,例如在 ImageNet 分类上实现最高达 9.0% 更高的准确率或 46.7% 的 FLOPs 减少,在 COCO 检测中在可比 FLOPs 下实现 81.3% 更高的 mAP。

关键词

引用

@article{arxiv.2505.16463,
  title  = {AnchorFormer: Differentiable Anchor Attention for Efficient Vision Transformer},
  author = {Jiquan Shan and Junxiao Wang and Lifeng Zhao and Liang Cai and Hongyuan Zhang and Ioannis Liritzis},
  journal= {arXiv preprint arXiv:2505.16463},
  year   = {2025}
}