AnchorFormer:高效视觉变换器的可微锚定注意力
计算机视觉与模式识别
2025-06-23 v3 机器学习
摘要
最近,视觉变换器 (ViT) 通过衡量图像块之间的全局自注意力在视觉任务上取得了优异性能。给定 个图像块,它们将具有二次复杂度,即 ,当以小颗粒度分割输入图像时,计算成本较高。同时,关键信息通常随机分布在输入图像的少数区域,一些 token 可能对下游任务无帮助。为处理此问题,我们引入一种基于锚点的高效视觉变换器 (AnchorFormer),其中采用锚 token 来学习关键信息并加速推理。首先,通过估计锚和 token 之间的二分注意力,复杂度将从 降低到 ,其中 为锚的数量且 。值得注意的是,通过将锚表示为神经网络层中的神经元,我们可以对这些锚进行可微学习,并通过马尔可夫过程近似全局自注意力。这避免了非可微操作带来的负担,并进一步加快了近似注意力速度。此外,我们将该模型扩展到包括分类、检测和分割三个下游任务。广泛的实验表明,AnchorFormer 的有效性,例如在 ImageNet 分类上实现最高达 9.0% 更高的准确率或 46.7% 的 FLOPs 减少,在 COCO 检测中在可比 FLOPs 下实现 81.3% 更高的 mAP。
引用
@article{arxiv.2505.16463,
title = {AnchorFormer: Differentiable Anchor Attention for Efficient Vision Transformer},
author = {Jiquan Shan and Junxiao Wang and Lifeng Zhao and Liang Cai and Hongyuan Zhang and Ioannis Liritzis},
journal= {arXiv preprint arXiv:2505.16463},
year = {2025}
}