中文

保持在甜点区:基于能力自适应提示脚手架的响应式推理演化

机器学习 2025-09-09 v1

摘要

强化学习与可验证奖励(RLVR)在增强大型语言模型(LLM)的推理能力方面取得了显著成功。然而,现有的 RLVR 方法往往由于训练数据难度与模型能力之间的不匹配而存在探索效率低下的问题。当问题过于困难时,LLM 无法发现可行的推理路径;而当问题过于简单时,LLM 几乎学不到新能力。在本工作中,我们通过量化损失下降速度与 rollout 准确率之间的关系,形式化了问题难度的影响。基于此分析,我们提出了 SEELE,一种新颖的监督辅助 RLVR 框架,可动态调整问题难度以使其保持在高效率区域内。SEELE 通过在原始问题后附加提示(完整解决方案的一部分)来增强每个训练样本。与以往基于提示的方法不同,SEELE 有意且自适应地调整每个问题的提示长度,以实现最优难度。为确定最优提示长度,SEELE 采用了一种多轮 rollout 采样策略。在每一轮中,它对前几轮收集的准确率-提示对拟合一个项目反应理论模型,以预测下一轮所需的提示长度。这种实例级的实时难度调整使问题难度与不断演化的模型能力相匹配,从而提高了探索效率。实验结果表明,SEELE 在六个数学推理基准上分别比 Group Relative Policy Optimization (GRPO) 和 Supervised Fine-tuning (SFT) 高出 +11.8 和 +10.5 个点,并平均超越此前最佳的监督辅助方法 +3.6 个点。

关键词

引用

@article{arxiv.2509.06923,
  title  = {Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding},
  author = {Ziheng Li and Zexu Sun and Jinman Zhao and Erxue Min and Yongcheng Zeng and Hui Wu and Hengyi Cai and Shuaiqiang Wang and Dawei Yin and Xu Chen and Zhi-Hong Deng},
  journal= {arXiv preprint arXiv:2509.06923},
  year   = {2025}
}

备注

Work in progress