从失败到反馈:分组修订解锁目标级定位中的困难案例
计算机视觉与模式识别
2026-05-18 v1
摘要
使用强化学习微调大型视觉-语言模型已成为增强其目标级定位能力的一种有前景的方法。然而,现有方法主要基于 GRPO,在响应级别分配奖励。这种稀疏的、通常由准则诱导的奖励,在所有候选响应在挑战性场景中都失败时,会导致学习信号极少。在本文中,我们提出了一种分组修订优化范式,以增强对困难案例的学习。它从一个采样的初始响应开始,并生成一组修订候选以探索改进的定位结果。受奖励塑造的启发,我们引入了一个整合过程,该过程量化每个候选相对于初始尝试的改进,并将其转换为信息丰富的塑造信号。这些信号用于精炼奖励并调制优势,从而放大高质量修订的影响。与先前的基于 GRPO 的模型相比,我们的方法在指称分割、推理分割、REC 和计数基准测试中取得了一致的增益。我们的代码可在 https://github.com/yyliu01/GroupRevision 获取。
引用
@article{arxiv.2605.15951,
title = {From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding},
author = {Yuyuan Liu and Yiping Ji and Anjie Le and Jiayuan Zhu and Jiazhen Pan and Can Peng and Jiajun Deng and Fengbei Liu and Junde Wu},
journal= {arXiv preprint arXiv:2605.15951},
year = {2026}
}
备注
8 pages, 5 figures, IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026