中文

不遗漏任何提示:通过熵引导的优势塑造利用 LLM 强化学习中的零方差提示

计算与语言 2026-02-10 v3 人工智能 机器学习

摘要

带可验证奖励的强化学习(RLVR)是提升大型语言模型(LLM)推理能力的强大框架。然而,当前方法(如 GRPO)仅依赖于模型对相同输入的响应在正确性上存在差异的问题,而忽略了所有响应获得相同奖励的问题,即所谓的零方差提示。在本工作中,我们论证了此类提示并非无用,事实上可以为策略优化提供有意义的反馈。为此,我们引入了带零方差提示的强化学习(RL-ZVP),一种从零方差提示中提取学习信号的新算法。RL-ZVP 即使在没有对比响应的情况下也直接奖励正确性并惩罚错误,通过 token 级别特征调节反馈,以保留信息丰富且细致的信号。在六个数学推理基准上,RL-ZVP 相较于 GRPO 在准确率上实现了高达 8.61 分、通过率上高达 7.77 分的显著提升,同时始终优于其他过滤掉零方差提示的基线方法。这些结果突显了在 RLVR 中从零方差提示学习的未开发潜力。项目页面:https://bltnynk.github.io/publications/rl-zvp/。

关键词

引用

@article{arxiv.2509.21880,
  title  = {No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping},
  author = {Thanh-Long V. Le and Myeongho Jeon and Kim Vu and Viet Lai and Eunho Yang},
  journal= {arXiv preprint arXiv:2509.21880},
  year   = {2026}
}

备注

ICLR 2026 camera-ready version