CrowdVLM-R1:使用模糊群组相对策略奖励将 R1 能力扩展至视觉语言模型以进行人群计数
计算机视觉与模式识别
2025-11-04 v2 计算与语言
摘要
我们提出了模糊群组相对策略奖励(FGRPR),这是一种将群组相对策略优化(GRPO)与模糊奖励函数相结合的新颖框架,旨在提高学习效率。与传统的二元0/1准确率奖励不同,我们的模糊奖励模型提供了细致的激励,鼓励更精确的输出。实验结果表明,带有标准0/1准确率奖励的GRPO的性能不如监督微调(SFT)。相比之下,应用于Qwen2.5-VL(3B和7B)的FGRPR在五个域内数据集上超越了所有基线模型,包括GPT4o、LLaMA2(90B)和SFT。在域外数据集上,FGRPR取得了与SFT相当的性能,但当目标值较大时表现尤为出色,因为其模糊奖励函数会对更接近的近似值分配更高的奖励。这种方法广泛适用于答案精度至关重要的任务。代码和数据:https://github.com/yeyimilk/CrowdVLM-R1
引用
@article{arxiv.2504.03724,
title = {CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward},
author = {Zhiqiang Wang and Pengbin Feng and Yanbin Lin and Shuzhang Cai and Zongao Bian and Jinghua Yan and Xingquan Zhu},
journal= {arXiv preprint arXiv:2504.03724},
year = {2025}
}
备注
10 pages, 6 figures and 4 tables