Syn-GRPO: 面向MLLM感知推理的自演化数据合成
计算机视觉与模式识别
2025-11-25 v1
摘要
RL(强化学习)方法(如GRPO)用于MLLM(多模态LLM)感知能力的研究近年来引起广泛关注, 由于其卓越的泛化能力。然而, 现有强化学习方法仍面临数据质量低的问题, 即数据样本无法从MLLM中引发多样化响应, 从而限制了MLLM强化学习的探索范围。一些方法试图通过施加熵约束来缓解此问题, 但未能从根本上解决。为此, 本工作提出Syn-GRPO (Synthesis-GRPO), 采用在线数据生成器合成具有多样化响应的高质量训练数据。具体而言, Syn-GRPO由两个组件构成: (1) 数据服务器; (2) GRPO工作流程。数据服务器利用图像生成模型从现有样本中合成新样本, 采用解耦且异步的方案以实现高效生成。GRPO工作流程为数据服务器提供新的图像描述, 并利用多样性奖励监督MLLM预测图像描述以合成具有多样化响应的样本。跨越三个视觉感知任务的实验结果表明, Syn-GRPO在数据质量上显著提升, 超越现有MLLM感知方法, Syn-GRPO展现出在长期自演化RL中具有巨大的潜力。我们的代码已公开于 https://github.com/hqhQAQ/Syn-GRPO。
引用
@article{arxiv.2511.19343,
title = {Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning},
author = {Qihan Huang and Haofei Zhang and Rong Wei and Yi Wang and Rui Tang and Mingli Song and Jie Song},
journal= {arXiv preprint arXiv:2511.19343},
year = {2025}
}