SAM3-I:基于指令的 Segment Anything
计算机视觉与模式识别
2026-04-17 v4
摘要
Segment Anything Model 3(SAM3)通过可提示的概念分割推进了开放词汇分割,使用户能够使用短名词短语(NP)提示对与给定概念相关联的所有实例进行分割。虽然对概念级 grounding 有效,但现实世界的交互往往涉及包含属性、关系、动作、状态或隐式推理的丰富自然语言指令。目前,SAM3 依赖外部多模态代理将复杂指令转换为 NP,并进行迭代掩码过滤,导致粗糙的表示和受限的实例特异性。本文提出了 SAM3-I,一种面向指令跟随的 SAM 系列扩展,统一概念级 grounding 与指令级推理于单一分割框架之内。基于 SAM3,SAM3-I 引入指令感知级联适应机制,配合专用对齐损失,逐步将富有表达力的指令语义与 SAM3 的视觉语言表示对齐,实现对自然语言指令的直接解释,同时保留其强大的概念召回能力。为实现指令跟随学习,我们引入 HMPL-Instruct,一个大规模以指令为中心的数据集,系统覆盖层次化指令语义和多样化的目标粒度。实验表明,SAM3-I 在指代和基于推理的分割任务上实现了令人满意的性能,表明 SAM3 可在不牺牲原有概念驱动优势的前提下,有效扩展以遵循复杂自然语言指令。代码和数据集已提供:https://github.com/debby-0527/SAM3-I。
引用
@article{arxiv.2512.04585,
title = {SAM3-I: Segment Anything with Instructions},
author = {Jingjing Li and Yue Feng and Yuchen Guo and Jincai Huang and Wei Ji and Qi Bi and Yongri Piao and Miao Zhang and Xiaoqi Zhao and Qiang Chen and Shihao Zou and Huchuan Lu and Li Cheng},
journal= {arXiv preprint arXiv:2512.04585},
year = {2026}
}