中文

VPNeXt -- 重新思考_plain Vision Transformer 的稠密解码

计算机视觉与模式识别 2025-09-30 v3

摘要

我们提出 VPNeXt,这是一种用于 Plain Vision Transformer (ViT) 的新颖且简单的数据模型。不同于众多相关研究共享的统一范式,VPNeXt 提供了一种关于 ViT 稠密表征的全新视角。具体而言,提出的 VPNeXt 针对现有范式提出两个关注点:(1) 是否需要使用复杂的 Transformer Mask Decoder 架构才能获得良好的表征?(2) Plain ViT 是否真正需要依赖虚构的 pyramid feature 进行上采样?针对 (1),我们研究了 Transformer 解码器有效性的潜在根本原因,并引入 Visual Context Replay (VCR) 以高效实现类似效果。针对 (2),我们引入 ViTUp 模块。该模块充分利用了此前被忽视的 ViT 真实金字塔特征,以实现比早期虚构金字塔特征更好的上采样效果。这标志着该功能在 Plain ViT 的语义分割领域的首次实现。我们对相关模块进行了消融研究,以逐步验证其有效性。我们进行了相关比较实验和可视化结果,表明 VPNeXt 以简单且有效的设计实现了最先进的性能。此外,提出的 VPNeXt 显著超越了长期存在的 VOC2012 数据集的 mIoU 壁垒/屏障,以大幅度实现最先进性能,这也是自 2015 年来提升幅度最大的一次。

关键词

引用

@article{arxiv.2502.16654,
  title  = {VPNeXt -- Rethinking Dense Decoding for Plain Vision Transformer},
  author = {Xikai Tang and Ye Huang and Guangqiang Yin and Lixin Duan},
  journal= {arXiv preprint arXiv:2502.16654},
  year   = {2025}
}

备注

Tech report, revised version