中文

SAM2 与 SAM3 之间的鸿沟:为什么基于提示的专长在概念驱动的图像分割中失效

计算机视觉与模式识别 2025-12-09 v1 人工智能

摘要

本文探讨了最新两代 Segment Anything Models(SAM)之间的根本性断裂:SAM2 与 SAM3。我们阐明了 SAM2 基于提示(points、boxes、masks)的分割方法为何无法移植到 SAM3 多模态概念驱动范式中。SAM2 通过空间提示实现纯几何与时序分割,而 SAM3 引入统一的视觉-语言架构,具备开放词汇推理、语义对齐、对比式对齐及类比式概念理解能力。我们通过五个核心维度展开分析:(1)从基于提示的分割到基于概念的分割的范式跃迁,对比 SAM2 的空间提示语义与 SAM3 的多模态融合与文本条件化掩码生成;(2)架构差异,详述 SAM2 的纯视觉-时序设计与 SAM3 集成的视觉-语言编码器、几何编码器、类比编码器、融合模块、DETR 风格解码器、对象查询及混合专家用于处理歧义的机制;(3)数据集与标注差异,对比 SA-V 视频掩码与 SAM3 的多模态概念标注语料库;(4)训练与超参数差异,说明为何 SAM2 的优化经验不适用于 SAM3;(5)评估指标、度量方式与失效模式,阐明从几何 IoU 度量向语义化、开放词汇评估的演进。综上,SAM3 代表了一种新的分割基础模型类别,为概念驱动分割时代的未来方向指明了路径。

关键词

引用

@article{arxiv.2512.06032,
  title  = {The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation},
  author = {Ranjan Sapkota and Konstantinos I. Roumeliotis and Manoj Karkee},
  journal= {arXiv preprint arXiv:2512.06032},
  year   = {2025}
}