中文

具有增强自注意力的轻量视觉 Transformer

计算机视觉与模式识别 2021-12-22 v1

摘要

尽管视觉 Transformer 模型具有令人印象深刻的表征能力,当前的轻量视觉 Transformer 模型仍受限于局部区域不一致且不准确的密集预测。我们怀疑其自注意力机制在更浅更窄的网络中能力受限。我们提出 Lite Vision Transformer(LVT),一种具有两种增强自注意力机制的新型轻量 Transformer 网络,以提升面向移动端部署的模型性能。对于低层特征,我们引入卷积自注意力(CSA)。与以往合并卷积与自注意力的方法不同,CSA 在 3x3 核内将局部自注意力引入卷积,以丰富 LVT 第一阶段的低层特征。对于高层特征,我们提出递归空洞自注意力(RASA),其在计算相似度图时利用多尺度上下文,并采用递归机制以极小的额外参数代价提升表征能力。LVT 的优越性在 ImageNet 识别、ADE20K 语义分割与 COCO 全景分割上得到验证。代码已公开可用。

关键词

引用

@article{arxiv.2112.10809,
  title  = {Lite Vision Transformer with Enhanced Self-Attention},
  author = {Chenglin Yang and Yilin Wang and Jianming Zhang and He Zhang and Zijun Wei and Zhe Lin and Alan Yuille},
  journal= {arXiv preprint arXiv:2112.10809},
  year   = {2021}
}