强化学习中的提示学习
机器学习
2026-04-02 v1 人工智能
计算与语言
摘要
组相对策略优化 (GRPO) 广泛用于具有可验证奖励的强化学习,但经常遭受优势崩溃:当一组中的所有采样轨迹获得相同奖励时,该组产生零相对优势,因此没有学习信号。例如,如果一个问题对推理器来说太难,所有采样轨迹都可能不正确并获得零奖励。近期工作通过为这些难题添加提示或辅助支架来解决此问题,使推理器产生混合结果并恢复非零更新。然而,现有的提示通常是固定的而非适应当前推理器,并且一个在提示输入下产生学习信号的提示不一定能改善测试时使用的无提示策略。为此,我们提出了强化学习中的提示学习 (HiLL),一个联合训练提示策略和推理策略的 RL 框架。对于每个难题,提示器根据当前推理器的错误采样轨迹在线生成提示,使提示生成能够适应推理器不断演化的错误。我们进一步引入提示依赖性,用于衡量正确提示轨迹对提示的依赖程度。我们推导出一个可迁移性结果,表明较低的提示依赖性意味着从提示成功到无提示成功的更强迁移,并利用此结果为提示器的训练定义迁移加权奖励。因此,HiLL 偏好那些不仅能恢复信息丰富的 GRPO 组,还能产生更可能改善原始无提示策略信号的提示。在多个基准上的实验表明,HiLL 一致优于 GRPO 和先前的基于提示的基线,展示了自适应和迁移感知的提示学习在 RL 中的价值。代码可在 https://github.com/Andree-9/HiLL 获取。
引用
@article{arxiv.2604.00698,
title = {Learning to Hint for Reinforcement Learning},
author = {Yu Xia and Canwen Xu and Zhewei Yao and Julian McAuley and Yuxiong He},
journal= {arXiv preprint arXiv:2604.00698},
year = {2026}
}