VG-Refiner:面向工具细化的指涉 grounded 推理
计算机视觉与模式识别
2025-12-09 v1
摘要
工具集成视觉推理(TiVR)在增强多模态问题解决方面展现了巨大潜力。然而,现有TiVR范式主要关注通过强化学习集成各种视觉工具,却忽略了设计有效的响应机制来处理不可靠或错误的工具输出。这一限制在指涉和定位任务中尤为突出,因为不准确的检测工具预测常会误导TiVR模型生成幻觉式推理。为此,我们提出了VG-Refiner,即首个旨在实现工具细化指涉 grounded 推理的框架。技术上,我们引入两种思考-重思机制,使模型能够显式分析并响应工具反馈,同时引入细化奖励以鼓励针对差労工具结果的有效纠正。此外,我们提出了两个新指标并建立了公平的评估协议,以系统性衡量当前模型的细化能力。我们采用少量任务特定数据来增强VG-Refiner的细化能力,在指涉和定位基准中实现了准确率和纠错能力的显著提升,同时保留了预训练模型的通用能力。
引用
@article{arxiv.2512.06373,
title = {VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning},
author = {Yuji Wang and Wenlong Liu and Jingxuan Niu and Haoji Zhang and Yansong Tang},
journal= {arXiv preprint arXiv:2512.06373},
year = {2025}
}
备注
The project page is [this url](https://github.com/VoyageWang/VG-Refiner)