基于轴向驱动的LLM强化学习深密探索
机器学习
2026-02-17 v1 人工智能
计算与语言
摘要
在大型语言模型的强化学习中,有效探索是关键挑战:在有限采样预算下发现广阔自然语言序列空间中的高质量轨迹。现有方法面临显著局限:GRPO仅从根部采样,使高概率轨迹饱和,同时未充分探索深层、易出错的状态;基于树的方法在平凡或不可恢复的状态上盲目分散预算,导致采样稀释,无法发现罕见正确后缀, destabilize local baselines。为此,我们提出Deep Dense Exploration(DDE)策略,聚焦于 unsuccessful trajectory中深层且可恢复的状态的pivots。我们通过DDE实现了DEEP-GRPO,引入了三个关键创新:(1) 一个轻量级数据驱动的效用函数,自动平衡recoverability和depth bias,以识别枢轴状态;(2) 在每个枢轴处进行局部密集采样,以提高发现正确后续轨迹的概率;(3) 引入双流优化目标,分离全局策略学习与局部纠错更新。在数学推理基准测试中,我们的方法持续优于GRPO、基于树的方法以及其他强基准。
引用
@article{arxiv.2602.14169,
title = {Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling},
author = {Yiran Guo and Zhongjian Qiao and Yingqi Xie and Jie Liu and Dan Ye and Ruiqing Zhang and Shuang Qiu and Lijie Xu},
journal= {arXiv preprint arXiv:2602.14169},
year = {2026}
}