S-GRPO:大型视觉语言模型的统一后训练方法
机器学习
2026-04-21 v1 计算与语言
计算机视觉与模式识别
摘要
当前针对大型视觉语言模型(LVLMs)的后训练方法 generally 落入两种范式:监督微调(SFT)和强化学习(RL)。尽管这两种方法广为使用,但在单独应用时都存在效率问题。SFT 强制模型沿单一专家轨迹生成,常因分布迁移导致通用多模态能力的灾难性遗忘。相反,RL 探索多个生成轨迹,但频繁遇到优化崩溃——即在稀疏奖励视觉任务中,未对齐模型无法自主采样有效轨迹的冷启动问题。本文提出监督组相对策略优化(S-GRPO),一种将仿真学习指导融入偏好优化中多轨迹探索的统一后训练框架。针对直接生成视觉任务,S-GRPO 引入条件地面轨迹注入(CGI)。当二元验证器检测到所采样轨迹组中出现完全探索性失败时,CGI 将经验证的地面轨迹注入候选池。通过为注入锚点分配确定性最大奖励,S-GRPO 在组相对优势估计中强制正向信号。该机制将监督学习目标重构为策略梯度的高优势组件,迫使模型在专家轨迹与探索新视觉概念之间动态平衡。理论分析和实验结果表明,S-GRPO 能无缝衔接 SFT 与 RL,显著加速收敛,并在保持基础模型通用能力的同时实现卓越的领域适应。
引用
@article{arxiv.2604.16557,
title = {S-GRPO: Unified Post-Training for Large Vision-Language Models},
author = {Yuming Yan and Kai Tang and Sihong Chen and Ke Xu and Dan Hu and Qun Yu and Pengfei Hu},
journal= {arXiv preprint arXiv:2604.16557},
year = {2026}
}