中文

视觉 Transformer 中的局部到全局自注意力

计算机视觉与模式识别 2021-07-13 v1

摘要

Transformer 在计算机视觉任务中展现出巨大潜力。为避免高分辨率视觉数据中自注意力的密集计算,一些近期 Transformer 模型采用分层设计,其中自注意力仅在局部窗口内计算。该设计显著提升了效率,但在早期阶段缺乏全局特征推理。在本工作中,我们设计了 Transformer 的多路径结构,使其在每个阶段能够以多种粒度实现局部到全局的推理。所提框架计算高效且极为有效。在计算开销仅微小增加的情况下,我们的模型在图像分类与语义分割上均取得显著提升。代码见 https://github.com/ljpadam/LG-Transformer

关键词

引用

@article{arxiv.2107.04735,
  title  = {Local-to-Global Self-Attention in Vision Transformers},
  author = {Jinpeng Li and Yichao Yan and Shengcai Liao and Xiaokang Yang and Ling Shao},
  journal= {arXiv preprint arXiv:2107.04735},
  year   = {2021}
}