金字塔视觉Transformer:一种无需卷积、适用于密集预测的通用骨干网络
计算机视觉与模式识别
2021-08-12 v2
摘要
尽管使用卷积神经网络(CNNs)作为骨干网络在计算机视觉中取得了巨大成功,本工作研究了一种简单且无需卷积、可用于许多密集预测任务的骨干网络。与近期专为图像分类设计的Transformer模型(如ViT)不同,我们提出了金字塔视觉Transformer(PVT),它克服了将Transformer移植到各种密集预测任务中的困难。与先前方法相比,PVT具有若干优点。(1)不同于通常具有低分辨率输出且计算与内存开销高的ViT,PVT不仅可以在图像密集分块上训练以获得高输出分辨率(这对密集预测至关重要),还使用渐进收缩金字塔来降低大特征图的计算量。(2)PVT继承了CNN和Transformer两者的优势,通过简单替换CNN骨干,使其成为各种视觉任务中无需卷积的统一骨干。(3)我们通过大量实验验证PVT,表明它提升了许多下游任务的性能,例如目标检测、语义和实例分割。例如,在参数量相当的情况下,RetinaNet+PVT在COCO数据集上取得40.4 AP,超越RetinNet+ResNet50(36.3 AP)4.1个绝对AP。我们希望PVT能作为像素级预测的一种替代且有用的骨干,并促进未来研究。代码见 https://github.com/whai362/PVT。
引用
@article{arxiv.2102.12122,
title = {Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions},
author = {Wenhai Wang and Enze Xie and Xiang Li and Deng-Ping Fan and Kaitao Song and Ding Liang and Tong Lu and Ping Luo and Ling Shao},
journal= {arXiv preprint arXiv:2102.12122},
year = {2021}
}
备注
Accepted to ICCV 2021