视觉 Transformer 中的局部到全局自注意力
计算机视觉与模式识别
2021-07-13 v1
摘要
Transformer 在计算机视觉任务中展现出巨大潜力。为避免高分辨率视觉数据中自注意力的密集计算,一些近期 Transformer 模型采用分层设计,其中自注意力仅在局部窗口内计算。该设计显著提升了效率,但在早期阶段缺乏全局特征推理。在本工作中,我们设计了 Transformer 的多路径结构,使其在每个阶段能够以多种粒度实现局部到全局的推理。所提框架计算高效且极为有效。在计算开销仅微小增加的情况下,我们的模型在图像分类与语义分割上均取得显著提升。代码见 https://github.com/ljpadam/LG-Transformer
引用
@article{arxiv.2107.04735,
title = {Local-to-Global Self-Attention in Vision Transformers},
author = {Jinpeng Li and Yichao Yan and Shengcai Liao and Xiaokang Yang and Ling Shao},
journal= {arXiv preprint arXiv:2107.04735},
year = {2021}
}