具有双向交互的轻量级视觉 Transformer
计算机视觉与模式识别
2025-02-28 v2
摘要
近期视觉骨干网络的进展通过同时建模图像的局部与全局上下文显著提升了性能。然而,这两种上下文之间的双向交互尚未得到充分探索与利用,而这在人类视觉系统中十分重要。本文提出一种用于视觉 Transformer 的全自适应自注意力(FASA)机制,以上下文感知的方式建模局部与全局信息及二者间的双向交互。具体而言,FASA 采用自调制卷积自适应提取局部表示,同时在下采样空间中利用自注意力提取全局表示。随后,它在局部与全局表示间执行双向适配过程以建模其交互。此外,我们引入细粒度下采样策略来增强下采样自注意力机制,以获得更细粒度的全局感知能力。基于 FASA,我们开发了一系列轻量级视觉骨干网络,即全自适应 Transformer(FAT)系列。在多个视觉任务上的大量实验表明 FAT 取得了令人印象深刻的性能。值得注意的是,FAT 仅用 4.5M 参数和 0.7G FLOPs 即在 ImageNet-1K 上达到 77.6% 的准确率,超越了同等模型规模与计算成本下最先进的 ConvNet 与 Transformer。此外,我们的模型在现代 GPU 上较其他模型速度更快。代码将发布于 https://github.com/qhfan/FAT。
引用
@article{arxiv.2306.00396,
title = {Lightweight Vision Transformer with Bidirectional Interaction},
author = {Qihang Fan and Huaibo Huang and Xiaoqiang Zhou and Ran He},
journal= {arXiv preprint arXiv:2306.00396},
year = {2025}
}
备注
The paper is accepted by NeurIPS2023