扫视与凝视视觉 Transformer
计算机视觉与模式识别
2021-06-07 v1
摘要
近来出现了一系列视觉 Transformer,得益于 Transformer 对长程依赖建模的强大能力,它们以比传统卷积神经网络更紧凑的模型规模展现出优越性能。然而,视觉 Transformer 的优势也伴随着代价:作为 Transformer 核心的自注意力机制,其复杂度相对于输入序列长度呈二次方增长。这导致随着序列长度增加,计算和内存开销急剧上升,从而在将 Transformer 应用于需要基于高分辨率特征图进行密集预测的视觉任务时带来困难。本文提出一种名为扫视与凝视 Transformer(GG-Transformer)的新型视觉 Transformer,以解决上述问题。其受人类在自然场景中识别物体时的扫视与凝视行为启发,能够高效建模长程依赖与局部上下文。在 GG-Transformer 中,扫视与凝视行为由两条并行分支实现:扫视分支通过对输入的自适应膨胀分块执行自注意力来实现,在保持全局感受野的同时获得线性复杂度;凝视分支由简单的深度可分离卷积层实现,将局部图像上下文补偿给扫视机制获得的特征。我们通过实验证明,我们的方法在各种视觉任务和基准上持续优于先前最先进的 Transformer。代码与模型将发布于 https://github.com/yucornetto/GG-Transformer。
引用
@article{arxiv.2106.02277,
title = {Glance-and-Gaze Vision Transformer},
author = {Qihang Yu and Yingda Xia and Yutong Bai and Yongyi Lu and Alan Yuille and Wei Shen},
journal= {arXiv preprint arXiv:2106.02277},
year = {2021}
}
备注
codes and models will be made available at https://github.com/yucornetto/GG-Transformer