中文

Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning

人工智能 2025-09-03 v1

摘要

以可验证反馈的强化学习(RLVF)已成为增强大型语言模型(LLM)推理能力的关键技术。然而,其对稀疏、基于结果的奖励的依赖 -- 这些奖励仅指示最终答案是否正确 -- 未能为推理过程本身提供细粒度的指导。这一限制阻碍了高效学习,因为模型无法区分高质量和低效的解决方案,也无法从不同类型的失败中有效学习。为此,我们观察到 LLM 的自我确定性通常与任务难度和解决方案质量相关联。我们引入 Difficulty Aware Certainty guided Exploration(DACE),一种新的 RL 算法,利用这一洞察来动态平衡探索-开发放弃的权衡。DACE 根据策略成功率在线评估任务难度,然后利用该信号来调制内在奖励:对于模型正在挣扎的困难任务,DACE 通过惩罚高确定性来鼓励探索;对于更容易的任务,它通过奖励高确定性来鼓励学习效率。在AIME、MATH等具有挑战性的数学推理基准测试上进行的实验表明,DACE 显著优于强基准。DACE 训练的模型不仅实现了更高的准确率,而且在扩展测试时计算资源时表现出更健壮的性能,这表明我们的自适应方法在不牺牲精度的前提下促进了有效的探索。

关键词

引用

@article{arxiv.2509.00125,
  title  = {Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning},
  author = {Ang Li and Zhihang Yuan and Yang Zhang and Shouda Liu and Yisen Wang},
  journal= {arXiv preprint arXiv:2509.00125},
  year   = {2025}
}