中文

PinPoint:基于信息性内部点的提示

计算机视觉与模式识别 2026-05-27 v1 计算与语言

摘要

现代指代图像分割管道将视觉-语言模型(VLM)用于 grounding, coupled with用于mask生成的可提示segmenter,如Segment Anything Model(SAM)。先前的训练-free实例始终落后于fine-tuned和强化学习(RL)-调优的专家,尚不清楚差距来自于VLM的grounding、SAM的容量,还是提示。我们表明,差距主要来自提示的模糊性:VLM提出的边界框(bbox)使SAM不知该如何判断bbox内部哪些像素属于表达式所指的对象。内部点是自然的消歧器,但其位置至关重要;先前工作依赖于naively采样的点,这些点落在边界、干扰项和背景杂乱上,甚至可能比bbox alone效果更差。监督和RL调优的方法通过训练VLM来预测更好的点来缩小这一差距;我们表明,这种训练是不必要的。在五个内部点的数额匹配下,用稳定、信息性的点选择替换naive采样可在RefCOCO/+/g上提高cumulative Intersection-over-Union(cIoU)12-18分,所有模型固定不变。我们将这一观察转化为PinPoint,一个确定性的、训练-free的点选择器,通过融合四种视觉线索生成共识图,选择靠近边界的紧凑、空间多样化的点,并使用冻结的VLM为每个点标记。没有任何任务特定训练,PinPoint就能在相同的堆栈上匹配监督和RL调优的专家,仅需每个查询调用两个VLM。

关键词

引用

@article{arxiv.2605.26689,
  title  = {PinPoint: Prompting with Informative Interior Points},
  author = {Pouya Sadeghi and Shawn He and Pedro Pablo Guerrero Vela and C. Thomas and Alex Wong and Sirisha Rambhatla},
  journal= {arXiv preprint arXiv:2605.26689},
  year   = {2026}
}