中文

REC-RL:基于高斯和区间奖励优化的指涉表达计数

计算机视觉与模式识别 2026-05-19 v1

摘要

指涉表达计数 (REC) 是一个需要上下文感知视觉推理的意图驱动任务。虽然最近的视觉语言模型已Incorporate语言进行视觉理解,但大多数现有 REC 方法依赖基于规则的强化学习,奖励主要聚焦于最终准确率,忽略中间推理质量。我们提出 REC-RL,一种引入 think-range-answer 范式的强化学习框架,用于显式优化视觉推理过程。REC-RL采用 Group Relative Policy Optimization,并引入两种轻量级奖励:一种结合区间监督与高斯精度指导的准确性奖励,以及用于强制结构化输出的格式奖励。通过将中间焦点预测建模为内部决策,REC-RL无需额外标注,能更好地与人类感知保持一致。大量实验表明,该方法在强基线上均实现持续改进,并在多个基准上表现出稳健的泛化能力。

关键词

引用

@article{arxiv.2605.16460,
  title  = {REC-RL: Referring expression counting via Gaussian and range-based reward optimization},
  author = {Hui Liu and Yunlai Teng and Kunlong Bai and Pengfei Qi and Haotian Yan and Liang Li and Junlan Feng},
  journal= {arXiv preprint arXiv:2605.16460},
  year   = {2026}
}

备注

5 pages