中文

Label Anything:基于视觉提示的多类少样本语义分割

计算机视觉与模式识别 2025-08-22 v4

摘要

少样本语义分割旨在使用有限的标注示例对先前未见的类别进行分割。本文介绍了 Label Anything,一种新颖的基于Transformer的架构,专为多提示、多路少样本语义分割设计。我们的方法利用多样化的视觉提示(点、边界框和掩码)构建了一个高度灵活且可泛化的框架,在显著降低标注负担的同时保持高准确率。Label Anything 作出了三项关键贡献:(i\textit{i})我们引入了一种新的任务 formulation,通过支持各种类型的提示、多类别分类以及在单个图像中允许多个提示,放宽了传统少样本分割的约束;(ii\textit{ii})我们提出了一种基于Transformer和注意力机制的新架构;(iii\textit{iii})我们设计了一个 versatile 的训练程序,使我们的模型能够无缝地适应不同的 NN way KK shot 和提示类型配置。我们在广泛使用的 COCO-20i20^i 基准上的大量实验评估表明,Label Anything 在现有多路少样本分割方法中实现了最先进的性能,而在多类别设置下也显著优于领先的单类别模型。代码和训练好的模型可在 https://github.com/pasqualedem/LabelAnything 获取。

关键词

引用

@article{arxiv.2407.02075,
  title  = {Label Anything: Multi-Class Few-Shot Semantic Segmentation with Visual Prompts},
  author = {Pasquale De Marinis and Nicola Fanelli and Raffaele Scaringi and Emanuele Colonna and Giuseppe Fiameni and Gennaro Vessio and Giovanna Castellano},
  journal= {arXiv preprint arXiv:2407.02075},
  year   = {2025}
}

备注

ECAI 2025 - 28th European Conference on Artificial Intelligence