Dr. Seg:通过感知导向设计重访视觉大语言模型的GRPO训练
计算机视觉与模式识别
2026-03-06 v2 人工智能
摘要
随着Group Relative Policy Optimization (GRPO)在基础大型语言模型中的成功日益增长,越来越多的研究试图将GRPO应用于视觉大语言模型(VLLMs)以进行视觉感知任务(如检测和分割)。然而,这一研究线题力求将语言推理所制定的训练范式能无缝迁移到视觉感知。我们的实验表明,这一假设并不成立,揭示了推理导向与感知导向设置之间的内在差异。以推理分割为典型案例,我们揭示了两个被忽视的因素:(i)需要更广泛的输出空间,(ii)对细粒度、稳定奖励的重要性。基于这些观察,我们提出了Dr.~Seg,一个简单、即插即用的数据驱动GRPO框架,包含一个Look-to-Confirm机制和一个Distribution-Ranked奖励模块,无需架构修改,能无缝集成到现有的GRPO-based VLLMs中。广泛的实验表明,Dr.~Seg在复杂视觉场景中提高了性能,同时保持了强大的泛化能力。代码、模型和数据集均可在https://github.com/eVI-group-SCU/Dr-Seg获取。
引用
@article{arxiv.2603.00152,
title = {Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design},
author = {Haoxiang Sun and Tao Wang and Chenwei Tang and Li Yuan and Jiancheng Lv},
journal= {arXiv preprint arXiv:2603.00152},
year = {2026}
}