中文

经验是最好的老师:激励强化学习中LLM的有效探索

人工智能 2026-03-23 v1

摘要

基于评分标准的强化学习(RL)最近在增强大型语言模型(LLMs)的通用推理能力方面取得了显著进展,但仍受限于仅限于当前策略分布的无效探索。事实上,RL 优化可视为将策略引导 toward 最大化奖励的理想分布,而有效探索应与所需目标保持一致。凭借这一洞见,我们提出HeRL——一种受 hindsight experience 指导的强化学习框架,通过明确告诉LLMs奖励中指定的期望行为来引导有效探索。具体而言,HeRL将沿着失败轨迹及其未满足的评分标准作为 hindsight experience,将其用作策略探索超出当前分布所需响应的 in-context 指导。此外,我们引入额外奖励以激励具有更大改进潜力的响应。在没有从零进行反复试验的情况下,HeRL可从所需的高质量样本中实现有效学习,理论上可获得更准确的预期梯度估计。广泛的实验表明,HeRL在各种基准测试中实现了超越基线的优异性能 Gains,并可进一步受益于经验驱动的自我改进。我们的代码可在 https://github.com/sikelifei/HeRL 上获得。

关键词

引用

@article{arxiv.2603.20046,
  title  = {Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs},
  author = {Wenjian Zhang and Kongcheng Zhang and Jiaxin Qi and Baisheng Lai and Jianqiang Huang},
  journal= {arXiv preprint arXiv:2603.20046},
  year   = {2026}
}