中文

P2T:用于场景理解的金字塔池化 Transformer

计算机视觉与模式识别 2022-09-01 v6

摘要

近来,视觉 Transformer 通过推进各类视觉任务的最先进水平取得了巨大成功。视觉 Transformer 中最具挑战性的问题之一是图像 token 的过长序列导致高计算成本(二次复杂度)。对此问题的一种流行解法是使用单一池化操作降低序列长度。本文考虑如何改进现有视觉 Transformer,其中单一池化操作提取的池化特征似乎不够强大。为此,我们注意到金字塔池化因其在上下文抽象上的强大能力已在各类视觉任务中被证明有效。然而,金字塔池化尚未在骨干网络设计中得到探索。为弥补这一空白,我们提出将金字塔池化引入视觉 Transformer 的多头自注意力(MHSA),在降低序列长度的同时捕获强大的上下文特征。结合我们基于池化的 MHSA,我们构建了名为金字塔池化 Transformer(P2T)的通用视觉 Transformer 骨干。大量实验表明,当将 P2T 用作骨干网络时,相较于以往的基于 CNN 和基于 Transformer 的网络,其在图像分类、语义分割、目标检测和实例分割等各类视觉任务中均展现出显著优越性。代码将发布于 https://github.com/yuhuan-wu/P2T。

关键词

引用

@article{arxiv.2106.12011,
  title  = {P2T: Pyramid Pooling Transformer for Scene Understanding},
  author = {Yu-Huan Wu and Yun Liu and Xin Zhan and Ming-Ming Cheng},
  journal= {arXiv preprint arXiv:2106.12011},
  year   = {2022}
}

备注

Accepted by IEEE TPAMI