中文

SAMIC:结合上下文空间提示工程的分割一切

计算机视觉与模式识别 2024-12-17 v1

摘要

少样本分割是指从少量带标注的参考图像中学习识别图像中特定类型物体(如飞机)的问题。当前的最先进水平是由为每个新领域特定应用构建资源密集型模型所驱动的。此类模型必须在包含不相关物体(如汽车、火车、动物)的海量带标注数据集上进行训练,以便将其“知识”迁移到新类型的物体上。在本文中,我们展示了如何利用现有的视觉基础模型 (VFMs) 来降低为新领域创建少样本分割模型的增量成本。具体而言,我们引入了 SAMIC,这是一个小型网络,它学习如何提示 VFMs,以便在领域特定应用中分割新类型的物体。SAMIC 使得任何任务都可以作为少样本学习问题来处理。该模型具有 260 万个参数,比领先模型(例如具有 4500 万个以上参数的 ResNet 101 主干网络)小 94%。即使仅使用单样本基准提供的 1/5 训练数据,SAMIC 在包括 COCO-20i20^i、Pascal-5i5^i、PerSeg、FSS-1000 和 NWPU VHR-10 在内的多种少样本和语义分割数据集上,也具有竞争力或达到了最先进的水平。

关键词

引用

@article{arxiv.2412.11998,
  title  = {SAMIC: Segment Anything with In-Context Spatial Prompt Engineering},
  author = {Savinay Nagendra and Kashif Rashid and Chaopeng Shen and Daniel Kifer},
  journal= {arXiv preprint arXiv:2412.11998},
  year   = {2024}
}