中文

探索 vs 剥夺:通过裁剪、熵和虚假奖励重思考 RLVR

机器学习 2026-01-27 v3 人工智能 计算与语言

摘要

本文检讨了强化学习可验证奖励(RLVR)框架中的探索-剥夺权衡,这一框架用于提高大语言模型(LLM)的推理能力。最近的研究表明,RLVR 可通过两种看似矛盾的机制来激发 LLM 的强数学推理能力:虚假奖励通过奖励与真实答案无关的产物来抑制剥夺,而熵最小化通过将模型推向更自信且更确定的输出来抑制探索,这凸显了一个令人困惑的动态:两者都抑制剥夺和抑制探索都能改善推理性能,但悬而未解的原则仍未能解释这些效应。我们聚焦两个根本问题:(i) 政策熵如何关系到性能,(ii) 虚假奖励是否会带来收益,可能通过裁剪偏差和模型污染的相互作用实现。我们的结果表明,虚假奖励下的裁剪偏差会降低政策熵,导致更自信、更确定的输出,而熵最小化本身不足以实现改进。我们进一步提出了奖励错位模型,解释了为何虚假奖励能在被污染的设置之外实现性能提升。我们的发现阐明了虚假奖励获益的机制,并为更有效的 RLVR 训练提供了原则。

关键词

引用

@article{arxiv.2512.16912,
  title  = {Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward},
  author = {Peter Chen and Xiaopeng Li and Ziniu Li and Wotao Yin and Xi Chen and Tianyi Lin},
  journal= {arXiv preprint arXiv:2512.16912},
  year   = {2026}
}

备注

Accepted by ICLR 2026