fg-expo:基于自适应KL与高斯课程的前沿引导探索优先策略优化
机器学习
2026-05-13 v1 人工智能
计算与语言
摘要
基于可验证奖励的强化学习已成为大语言模型数学推理的标准范式,其中组相对策略优化是主导算法。我们发现了 GRPO 中两个被忽视的低效问题。首先,固定的 KL 系数在模型需要显著偏离参考策略的时刻过度限制了策略探索。其次,均匀的问题采样忽略了中等难度问题能产生信息量最大的梯度信号这一事实。我们提出 FG-ExPO,即前沿引导探索优先策略优化,它集成了两个轻量级组件。精度条件 KL 缩放通过批次平均精度的平滑非线性函数调整 KL 惩罚强度,在模型表现不佳时放松约束,在模型取得满意结果时加强约束。高斯课程采样按照以中等精度水平(约 0.5)为中心的高斯分布为问题分配采样权重,将模型训练集中在其学习前沿。我们在 DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen3-8B-Base 上,跨六个主流数学推理基准进行了评估。实验结果表明,FG-ExPO 始终优于原始 GRPO。它在 AIME 2025 的 pass@32 指标上实现了 13.34 的绝对提升,从 63.33% 提高到 76.67%,并在 8B 模型上获得了 2.66 的平均 pass@32 增益。与 pass@1 相比,在 pass@32 上观察到的显著更大的性能提升验证了 FG-ExPO 在固定推理预算下扩大了模型的有效探索空间。
引用
@article{arxiv.2605.11403,
title = {fg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculum},
author = {Mingxiong Lin and Zhangquan Gong and Maowen Tang and Qian Li and Chuangchuang Wang and Jian Ma and Sutian Huang and Kai Tang and Haonan Lu},
journal= {arXiv preprint arXiv:2605.11403},
year = {2026}
}