中文

CrowdVLM-R1:使用模糊群组相对策略奖励将 R1 能力扩展至视觉语言模型以进行人群计数

计算机视觉与模式识别 2025-11-04 v2 计算与语言

摘要

我们提出了模糊群组相对策略奖励(FGRPR),这是一种将群组相对策略优化(GRPO)与模糊奖励函数相结合的新颖框架,旨在提高学习效率。与传统的二元0/1准确率奖励不同,我们的模糊奖励模型提供了细致的激励,鼓励更精确的输出。实验结果表明,带有标准0/1准确率奖励的GRPO的性能不如监督微调(SFT)。相比之下,应用于Qwen2.5-VL(3B和7B)的FGRPR在五个域内数据集上超越了所有基线模型,包括GPT4o、LLaMA2(90B)和SFT。在域外数据集上,FGRPR取得了与SFT相当的性能,但当目标值较大时表现尤为出色,因为其模糊奖励函数会对更接近的近似值分配更高的奖励。这种方法广泛适用于答案精度至关重要的任务。代码和数据:https://github.com/yeyimilk/CrowdVLM-R1

关键词

引用

@article{arxiv.2504.03724,
  title  = {CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward},
  author = {Zhiqiang Wang and Pengbin Feng and Yanbin Lin and Shuzhang Cai and Zongao Bian and Jinghua Yan and Xingquan Zhu},
  journal= {arXiv preprint arXiv:2504.03724},
  year   = {2025}
}

备注

10 pages, 6 figures and 4 tables