中文

InstructSAM:根据任意指令分割任意实例

计算机视觉与模式识别 2026-05-26 v1

摘要

本文我们引入 InstructSAM,一个用于任意指令下多实例分割的统一且简洁的框架。我们将指令驱动的实例分割建模为集合结构查询预测问题,提出一种明确的从推理到实例查询的界面优雅地桥接了视觉语言模型 (VLM) 和 SAM3。具体地,注入一组可学习的实例查询到 VLM 中,并结合指令和视觉信息进行上下文化,使每个查询都可作为实例感知槽位。一种混合注意力机制进一步促进了这些查询、视觉标记和指令标记之间的相互作用,提高实例枚举并减少重复预测。得到的由 LLM 条件化的查询被投影到 SAM3 的检测查询空间,以驱动准确的单次前向传递实现多实例分割。该设计使 SAM3 具备高层指令理解、组合推理和实例级集合预测能力,而无需修改其核心架构。为支持训练和评估,我们进一步构建了 Inst2Seg,一个高质量且大规模的基于指令的实例分割数据集和基准, 将自由形式指令与实例级掩码耦合在一起。广泛实验表明,仅需 2B 参数规模的 InstructSAM 在复杂指令驱动和短语级指称分割基准上均表现出强劲结果,超越了先前的端到端方法和 SAM3 的代理管线,同时实现高效的单次多实例预测。

关键词

引用

@article{arxiv.2605.26102,
  title  = {InstructSAM: Segment Any Instance with Any Instructions},
  author = {Yuqian Yuan and Wentong Li and Zhaocheng Li and Yutong Lin and Juncheng Li and Siliang Tang and Jun Xiao and Yueting Zhuang and Wenqiao Zhang},
  journal= {arXiv preprint arXiv:2605.26102},
  year   = {2026}
}

备注

19 pages, 8 figures