中文

面向开放式 ad-hoc 分割的视觉引导智能体

计算机视觉与模式识别 2026-05-20 v1

摘要

分割在概念已知时变得容易,仅需从文本中检索已学习的视觉 grounding。但对于开放式 ad-hoc 概念,grounding 常不作为一个已学习的掩码存在,需通过图像证据中的部件、关系、排除和集合来构建。我们提出Vision-guided Ad-hoc Segmentation Agent(VASA),首个用于开放式 ad-hoc 分割的视觉驱动智能体。VASA 无需训练,融合了视觉语言模型(VLM)智能体、分割基础模型和视觉驱动的工作流程。不同于仅修改文本提示,VASA 使用持久的工作掩码进行推理、构建和验证。它规划视觉操作、调用分割工具、检查结果、编辑掩码并从错误中恢复。我们构建了 PARS 数据集,将 PartImageNet 中的部件级标签转化为通过长形式定义查询生成的开放式 ad-hoc 概念。在 PARS 上,VASA 在开放词汇、基于推理和智能体基线中均超越 SAM3 Agent 14--25%。在标准的多粒度指代分割基准 RefCOCOm 上,VASA 相比 SAM3 Agent 提升5--9%,相比其他智能体基线提升最高可达20%。这些结果验证了智能体视觉构造在开放式 ad-hoc 分割中的有效性。我们的工作指向超越将基础模型包装为工具的AI智能体路径:以任务知识、VLM 行为、视觉例程、工作记忆和容错工作流程进行编程。

关键词

引用

@article{arxiv.2605.19410,
  title  = {Vision Harnessing Agent for Open Ad-hoc Segmentation},
  author = {Zilin Wang and Stella X. Yu},
  journal= {arXiv preprint arXiv:2605.19410},
  year   = {2026}
}

备注

23 pages, 11 figures