中文

面向通用图像分割的Vision Transformer中缺失的点

计算机视觉与模式识别 2025-12-10 v2 人工智能 机器学习 图像与视频处理

摘要

图像分割仍然是计算机视觉中一项具有挑战性的任务,需要鲁棒的掩码生成和精确的分类。近期基于掩码的方法通过捕获全局上下文生成了高质量的掩码。然而,准确地对这些掩码进行分类(尤其是在存在模糊边界和类别分布不平衡的情况下)仍然是一个开放性挑战。在这项工作中,我们引入了ViT-P,这是一种新颖的两阶段分割框架,将掩码生成与分类解耦。第一阶段采用提议生成器生成类别无关的掩码提议,而第二阶段利用基于Vision Transformer(ViT)构建的基于点的分类模型,通过关注掩码中心点来细化预测。ViT-P作为一个无需预训练的适配器,允许在不修改架构的情况下集成各种预训练的Vision Transformer,确保了对密集预测任务的适应性。此外,我们证明了粗略和边界框标注可以有效增强分类,而无需在精细标注数据集上进行额外训练,从而在保持强大性能的同时降低了标注成本。在COCO、ADE20K和Cityscapes数据集上的大量实验验证了ViT-P的有效性,在ADE20K全景分割上取得了54.0 PQ、在Cityscapes语义分割上取得了87.4 mIoU、在ADE20K语义分割上取得了63.6 mIoU的最先进结果。代码和预训练模型可在以下地址获取:https://github.com/sajjad-sh33/ViT-P}{https://github.com/sajjad-sh33/ViT-P。

关键词

引用

@article{arxiv.2505.19795,
  title  = {The Missing Point in Vision Transformers for Universal Image Segmentation},
  author = {Sajjad Shahabodini and Mobina Mansoori and Farnoush Bayatmakou and Jamshid Abouei and Konstantinos N. Plataniotis and Arash Mohammadi},
  journal= {arXiv preprint arXiv:2505.19795},
  year   = {2025}
}