中文

EATFormer:受进化算法启发的视觉 Transformer 改进

计算机视觉与模式识别 2024-08-13 v3 新兴技术

摘要

受生物进化启发,本文通过与经过验证的实用进化算法进行类比,解释了视觉 Transformer 的合理性,并推导出两者具有一致的数学表述。随后,受有效的进化算法变体启发,我们提出了一种新颖的金字塔式 EATFormer 骨干网络,该网络仅包含所提出的基于进化算法的 Transformer(EAT)模块。该模块由三个残差部分组成,即多尺度区域聚合、全局与局部交互以及前馈网络模块,分别用于建模多尺度、交互和个体信息。此外,我们设计了一个与 Transformer 骨干对接的任务相关头部,以更灵活地完成最终信息融合,并改进了一种可调制可变形 MSA 以动态建模不规则位置。在图像分类、下游任务和解释性实验上的大量定量与定性实验证明了我们方法相较于最先进方法的有效性和优越性。例如,我们的 Mobile (1.8 M)、Tiny (6.1 M)、Small (24.3 M) 和 Base (49.0 M) 模型仅使用朴素训练配方在 ImageNet-1K 上训练,即分别达到 69.4、78.4、83.1 和 83.9 的 Top-1 准确率;配备 Mask-R-CNN 的 EATFormer-Tiny/Small/Base 在 COCO 检测任务上分别获得 45.4/47.4/49.0 的 box AP 和 41.4/42.9/44.2 的 mask AP,以更少的 FLOPs 分别超越同期的 MPViT-T、Swin-T 和 Swin-S 0.6/1.4/0.5 box AP 和 0.4/1.3/0.9 mask AP;我们的 EATFormer-Small/Base 通过 Upernet 在 ADE20K 上分别达到 47.3/49.3 mIoU,超过 Swin-T/S 2.8/1.7。代码开源在 https://github.com/zhangzjn/EATFormer。

关键词

引用

@article{arxiv.2206.09325,
  title  = {EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm},
  author = {Jiangning Zhang and Xiangtai Li and Yabiao Wang and Chengjie Wang and Yibo Yang and Yong Liu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2206.09325},
  year   = {2024}
}

备注

IJCV'2024