中文

具有分层池化的可扩展视觉 Transformer

计算机视觉与模式识别 2021-08-19 v2

摘要

近期提出的纯注意力视觉图像 Transformer (ViT) 在图像分类等图像识别任务上取得了有前景的性能。然而,当前 ViT 模型的常规做法是在推理过程中维持全长度块序列,这存在冗余且缺乏分层表示。为此,我们提出一种分层视觉 Transformer (HVT),其逐步池化视觉 token 以缩短序列长度,从而降低计算开销,类似于卷积神经网络 (CNNs) 中的特征图下采样。这带来一大优势:我们可以通过扩展深度/宽度/分辨率/块大小等维度来提升模型容量,而因序列长度缩减不会引入额外的计算复杂度。此外,我们通过实验发现平均池化的视觉 token 比单一类 token 包含更具判别性的信息。为证明我们的 HVT 具有改进的可扩展性,我们在图像分类任务上进行了大量实验。在可比的 FLOPs 下,我们的 HVT 在 ImageNet 与 CIFAR-100 数据集上优于具有竞争力的基线。代码见 https://github.com/MonashAI/HVT

关键词

引用

@article{arxiv.2103.10619,
  title  = {Scalable Vision Transformers with Hierarchical Pooling},
  author = {Zizheng Pan and Bohan Zhuang and Jing Liu and Haoyu He and Jianfei Cai},
  journal= {arXiv preprint arXiv:2103.10619},
  year   = {2021}
}

备注

Accepted to Proc. Int. Conf. Computer Vision (ICCV), 2021