中文

特征金字塔Transformer

计算机视觉与模式识别 2020-07-21 v1

摘要

跨空间与尺度的特征交互是现代视觉识别系统的基础,因为它们引入了有益的视觉上下文。传统上,空间上下文被动地隐藏在CNN不断增大的感受野中,或主动地由非局部卷积编码。然而,非局部空间交互并不跨尺度,因此无法捕获位于不同尺度上的物体(或部件)的非局部上下文。为此,我们提出了一种跨空间与尺度的完全主动特征交互方法,称为特征金字塔Transformer(FPT)。它使用三种专门设计的Transformer,以自层级、自上而下和自下而上的交互方式,将任意特征金字塔转换为另一个大小相同但上下文更丰富的特征金字塔。FPT作为一种通用视觉骨干网络,具有合理的计算开销。我们在实例级(即目标检测与实例分割)和像素级分割任务中使用多种骨干网络和头部网络进行了大量实验,观察到相比所有基线方法和最先进方法均有持续提升。

关键词

引用

@article{arxiv.2007.09451,
  title  = {Feature Pyramid Transformer},
  author = {Dong Zhang and Hanwang Zhang and Jinhui Tang and Meng Wang and Xiansheng Hua and Qianru Sun},
  journal= {arXiv preprint arXiv:2007.09451},
  year   = {2020}
}

备注

Published at the European Conference on Computer Vision, 2020