面向视觉 grounding 的基于课程的相对策略优化
计算机视觉与模式识别
2025-11-19 v1
摘要
链式思维 (Chain-of-Thought, CoT) 提示最近在各种 NLP 和计算机视觉任务中展现出显著潜力,通过显式生成中间推理步骤。然而,我们发现基于强化学习的 CoT 微调在视觉 grounding 任务中可能产生悖论性的性能下降,特别是当 CoT 输出变得冗长或复杂时。此外,我们的分析揭示,数据集规模的增加并不总是提升性能 due to 数据复杂度的差异。基于这些发现,我们提出了 Curriculum-based Relative Policy Optimization (CuRPO),一种新颖的训练策略,利用 CoT 长度和广义交并比 (gIoU) 奖励作为复杂度指标,逐步构建从简单到复杂的训练数据。对 RefCOCO、RefCOCO+、RefCOCOg 和 LISA 数据集上的大量实验表明,我们方法的有效性。CuRPO 持续优于现有方法,包括 Visual-RFT, 在 RefCOCO 上提升最高可达 +12.52 mAP。此外,CuRPO 表现出卓越的效率和鲁棒性,即使在 few-shot 学习场景下也能提供强大的局化性能,尤其受益于描述模糊且复杂的任务。代码已发布于 https://github.com/qyoung-yan/CuRPO。
关键词
引用
@article{arxiv.2511.13924,
title = {Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding},
author = {Qingyang Yan and Guangyao Chen and Yixiong Zou},
journal= {arXiv preprint arXiv:2511.13924},
year = {2025}
}
备注
AAAI 2026 (Oral)