中文

原生分割视觉Transformer

计算机视觉与模式识别 2025-05-23 v1 机器学习

摘要

均匀下采样仍然是视觉骨干网络中降低空间分辨率的事实标准。在本工作中,我们提出了一种替代设计,其核心是内容感知的空间分组层,能够根据图像边界及其语义内容将token动态分配至缩减集合。将我们的分组层堆叠在连续的骨干网络阶段中,可在特征提取过程中原生地产生层次分割,由此我们提出了原生分割视觉Transformer。我们表明,通过对架构的精心设计,仅凭分组层即可涌现出强大的分割掩码,即无需额外的分割专用头。这为原生、骨干网络级分割的新范式奠定了基础,该范式可在无掩码监督的情况下实现强大的零样本结果,同时也为下游分割任务提供了一种精简高效的单模型设计。我们的项目页面为https://research.nvidia.com/labs/dvl/projects/native-segmentation。

关键词

引用

@article{arxiv.2505.16993,
  title  = {Native Segmentation Vision Transformers},
  author = {Guillem Brasó and Aljoša Ošep and Laura Leal-Taixé},
  journal= {arXiv preprint arXiv:2505.16993},
  year   = {2025}
}