中文

你的 ViT 其实是一个图像分割模型

计算机视觉与模式识别 2025-03-26 v1

摘要

Vision Transformers (ViTs) 在计算机视觉任务中表现突出且具备良好的可扩展性。将单尺度 ViT 应用于图像分割时,现有方法采用卷积适配器生成多尺度特征、像素解码器融合这些特征,以及使用融合特征的 Transformer 解码器进行预测。本文表明,这些任务特定组件引入的归纳偏置实际上可以通过 ViT 本身学习到,前提是模型规模足够大且进行了大规模预训练。基于这些发现,我们提出了 Encoder-only Mask Transformer (EoMT),将普通 ViT 架构复用以进行图像分割。通过大规模模型和预训练,EoMT 获得的分割精度与使用任务特定组件的先进模型相当。与此同时,EoMT 由于架构简单,速度显著更快,例如在 ViT-L 上快达4倍。跨越多个模型规模,EoMT 在分割精度与预测速度之间实现了最佳平衡,表明计算资源更应用于扩展 ViT 本身,而非增加架构复杂度。代码:https://www.tue-mps.org/eomt/。

关键词

引用

@article{arxiv.2503.19108,
  title  = {Your ViT is Secretly an Image Segmentation Model},
  author = {Tommie Kerssies and Niccolò Cavagnero and Alexander Hermans and Narges Norouzi and Giuseppe Averta and Bastian Leibe and Gijs Dubbelman and Daan de Geus},
  journal= {arXiv preprint arXiv:2503.19108},
  year   = {2025}
}

备注

CVPR 2025. Code: https://www.tue-mps.org/eomt/