中文

重新审视轻量级视觉Transformer中的局部感知

计算机视觉与模式识别 2023-06-02 v5

摘要

视觉Transformer(ViTs)已被证明在各类视觉任务中有效。然而,将其缩放至移动端友好尺寸会导致显著性能下降。因此,开发轻量级视觉Transformer已成为关键研究方向。本文引入 CloFormer,一种利用上下文感知局部增强的轻量级视觉Transformer。CloFormer 探究了原始卷积算子中常用的全局共享权重与注意力中出现的令牌特定上下文感知权重之间的关系,进而提出一个有效且简洁的模块来捕获高频局部信息。在 CloFormer 中,我们引入 AttnConv,一种注意力风格的卷积算子。所提 AttnConv 使用共享权重聚合局部信息,并部署精心设计的上下文感知权重来增强局部特征。AttnConv 与采用池化以降低 FLOPs 的原始注意力的组合使模型能够感知高频与低频信息。我们在图像分类、目标检测与语义分割上进行了充分实验,证明了 CloFormer 的优越性。代码见 \url{https://github.com/qhfan/CloFormer}。

关键词

引用

@article{arxiv.2303.17803,
  title  = {Rethinking Local Perception in Lightweight Vision Transformer},
  author = {Qihang Fan and Huaibo Huang and Jiyang Guan and Ran He},
  journal= {arXiv preprint arXiv:2303.17803},
  year   = {2023}
}