中文

具有渐进式采样的视觉Transformer

计算机视觉与模式识别 2021-08-05 v1

摘要

具有强大全局关系建模能力的Transformer最近被引入到基础计算机视觉任务中。作为一个典型例子,视觉Transformer(ViT)直接将纯Transformer架构应用于图像分类,通过简单地将图像分割成固定长度的令牌,并利用Transformer来学习这些令牌之间的关系。然而,这种朴素的令牌化方式可能会破坏物体结构,将网格分配给不感兴趣的区域(如背景),并引入干扰信号。为了缓解上述问题,在本文中,我们提出了一种迭代和渐进式的采样策略来定位判别性区域。在每次迭代中,当前采样步骤的嵌入被送入一个Transformer编码器层,并预测一组采样偏移量,以更新下一步的采样位置。渐进式采样是可微分的。当与视觉Transformer结合时,所得到的PS-ViT网络可以自适应地学习看向何处。所提出的PS-ViT既有效又高效。当在ImageNet上从头开始训练时,PS-ViT的top-1准确率比原始ViT高出3.8%,而参数量减少了约4倍,FLOPs减少了约10倍。代码可在https://github.com/yuexy/PS-ViT获取。

关键词

引用

@article{arxiv.2108.01684,
  title  = {Vision Transformer with Progressive Sampling},
  author = {Xiaoyu Yue and Shuyang Sun and Zhanghui Kuang and Meng Wei and Philip Torr and Wayne Zhang and Dahua Lin},
  journal= {arXiv preprint arXiv:2108.01684},
  year   = {2021}
}

备注

Accepted to ICCV 2021