Poivre:基于强化学习的自我完善式视觉指向
计算机视觉与模式识别
2025-09-30 v1 人工智能
摘要
视觉指向旨在通过预测图像上的坐标来定位目标,已成为视觉语言模型 (VLM) 中重要问题。尽管具有广泛适用性,但最近的基准显示当前 VLM 在该任务上远不如人类水平。关键限制在于,VLM 通常被要求在单一步骤内完成指向任务,类似于要求人类在未看到手指的情况下直接指向物体。为此,我们提出一种简单而有效的自我完善程序:Point,Visualize,然后 Refine (Poivre)。该程序使 VLM 能够首先标记其估计的点,然后在必要时迭代细化坐标。灵感来自自然语言领域推理模型的进展,我们采用强化学习 (RL) 来激励这种自我完善能力。对于 RL 训练,我们设计了一种既实证有效又具吸引属性的过程奖励。我们的训练模型 Poivre-7B 在 Point-Bench 上设下新纪录,超越专有模型如 Gemini-2.5-Pro 和大型开源模型如 Molmo-72B 超过 3%。为支持未来研究,我们发布了训练和推理代码、数据集以及 Poivre-7B 检查点。
关键词
引用
@article{arxiv.2509.23746,
title = {Poivre: Self-Refining Visual Pointing with Reinforcement Learning},
author = {Wenjie Yang and Zengfeng Huang},
journal= {arXiv preprint arXiv:2509.23746},
year = {2025}
}