TransNeXt:面向视觉 Transformer 的鲁棒中央凹视觉感知
计算机视觉与模式识别
2024-04-23 v3 人工智能
摘要
由于残差连接中的深度退化效应,许多依赖堆叠层进行信息交换的高效视觉 Transformer 模型往往无法形成充分的信息混合,导致不自然的视觉感知。为解决此问题,本文提出聚合注意力(Aggregated Attention),一种基于仿生设计的令牌混合器,其模拟生物中央凹视觉与连续眼动,同时使特征图上的每个令牌具备全局感知。此外,我们引入与常规查询和键交互的可学习令牌,使亲和度矩阵的生成超越仅依赖查询与键相似度,进一步多样化。我们的方法不依赖堆叠进行信息交换,从而有效避免深度退化并实现自然视觉感知。另外,我们提出卷积 GLU,一种桥接 GLU 与 SE 机制的通道混合器,使每个令牌能基于其最近邻图像特征拥有通道注意力,增强局部建模能力与模型鲁棒性。我们将聚合注意力与卷积 GLU 结合,创建称为 TransNeXt 的新视觉骨干。大量实验表明,我们的 TransNeXt 在多种模型规模下均达到最先进性能。在 分辨率下,TransNeXt-Tiny 取得 84.0% 的 ImageNet 准确率,以少 69% 的参数超越 ConvNeXt-B。我们的 TransNeXt-Base 在 分辨率下取得 86.2% 的 ImageNet 准确率与 61.6% 的 ImageNet-A 准确率、57.1 的 COCO 目标检测 mAP,以及 54.7 的 ADE20K 语义分割 mIoU。
引用
@article{arxiv.2311.17132,
title = {TransNeXt: Robust Foveal Visual Perception for Vision Transformers},
author = {Dai Shi},
journal= {arXiv preprint arXiv:2311.17132},
year = {2024}
}
备注
CVPR 2024 Camera-ready Version. Project Page: https://github.com/DaiShiResearch/TransNeXt