中文

PVT v2:基于金字塔视觉 Transformer 的改进基线

计算机视觉与模式识别 2023-04-18 v7

摘要

Transformer 近期在计算机视觉中展现出令人鼓舞的进展。本工作中,我们通过三项设计改进原始的金字塔视觉 Transformer(PVT v1),给出新的基线,包括(1)线性复杂度注意力层,(2)重叠图像块嵌入,以及(3)卷积前馈网络。借助这些修改,PVT v2 将 PVT v1 的计算复杂度降至线性,并在分类、检测和分割等基础视觉任务上取得显著改进。值得注意的是,所提出的 PVT v2 取得了与 Swin Transformer 等近期工作相当或更好的性能。我们希望本工作能推动计算机视觉中最先进的 Transformer 研究。代码见 https://github.com/whai362/PVT。

关键词

引用

@article{arxiv.2106.13797,
  title  = {PVT v2: Improved Baselines with Pyramid Vision Transformer},
  author = {Wenhai Wang and Enze Xie and Xiang Li and Deng-Ping Fan and Kaitao Song and Ding Liang and Tong Lu and Ping Luo and Ling Shao},
  journal= {arXiv preprint arXiv:2106.13797},
  year   = {2023}
}

备注

Accepted to CVMJ 2022