中文

SAM 3:基于概念提示的分割任何模型

计算机视觉与模式识别 2026-03-31 v2 人工智能

摘要

我们提出了分割任何模型(SAM 3),这是一种统一模型,能够基于概念提示(concept prompts)在图像和视频中检测、分割和跟踪物体。概念提示被定义为短名词短语(例如"yellow school bus")、图像示例或两者的组合。提示驱动的概念分割(PCS)接受此类提示并返回所有匹配物体实例的分割掩码和唯一身份标识。为推进PCS,我们构建了一个可扩展的数据引擎,产生了包含400万个唯一概念标签(包括硬负样本)的高质量数据集,涵盖图像和视频。我们的模型包含一个图像级检测器和一个基于记忆的视频跟踪器,它们共享一个单一的主干网络。通过引入存在头部(presence head)将识别与定位解耦,这一做法提升了检测精度。SAM 3 在图像和视频 PCS 中将现有系统的准确率翻倍,并在视觉分割任务方面提升了前一代SAM的能力。我们将开源SAM 3以及新的面向提示驱动概念分割的Segment Anything with Concepts(SA-Co)基准。

关键词

引用

@article{arxiv.2511.16719,
  title  = {SAM 3: Segment Anything with Concepts},
  author = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman Rädle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Dollár and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
  journal= {arXiv preprint arXiv:2511.16719},
  year   = {2026}
}