中文

面向视觉Transformer的动态粒度编码器

计算机视觉与模式识别 2023-01-11 v1

摘要

Transformer作为语言建模的事实标准,近来已被应用于视觉任务。本文为视觉Transformer引入稀疏查询,以利用自然图像固有的空间冗余并节省计算成本。具体而言,我们提出了一种面向视觉Transformer的动态粒度编码器,其能够自适应地为每个空间区域分配合适数量的查询。从而在保持高效率的同时,在判别性区域实现细粒度表示。此外,该动态粒度编码器与大多数视觉Transformer框架兼容。无需额外技巧,我们的编码器使最先进的视觉Transformer在图像分类上保持可比性能的同时,将计算复杂度降低40%–60%。在目标检测与分割上的大量实验进一步证明了我们方法的泛化性。代码见 https://github.com/StevenGrove/vtpack。

关键词

引用

@article{arxiv.2301.03831,
  title  = {Dynamic Grained Encoder for Vision Transformers},
  author = {Lin Song and Songyang Zhang and Songtao Liu and Zeming Li and Xuming He and Hongbin Sun and Jian Sun and Nanning Zheng},
  journal= {arXiv preprint arXiv:2301.03831},
  year   = {2023}
}

备注

Accepted by NeurIPS2021