中文

解锁RLVR中的探索:基于不确定性感知的优势塑形以实现更深层推理

人工智能 2026-04-17 v2

摘要

基于可验证奖励的强化学习(RLVR)已显示出显著提升大型语言模型(LLM)推理能力的潜力。然而,主流算法如GRPO会在序列中所有token上广播统一的优势信号。这一粗粒度方法忽略了不确定性高、决策关键的时刻在推理中的关键作用,导致探索效率低下,并加剧了熵崩溃这一已知问题。为此,我们引入UnCertainty-aware Advantage Shaping(UCAS),一种无模型的方法,通过利用模型内部的不确定性信号来细化信用分配。UCAS包含两个阶段:首先,使用logit空间的自信度 proxy 调制响应层面的优势;其次,基于原始logit确定性施加非对称的token级惩罚。这一双重机制鼓励探索能产出正确答案的高不确定性路径,同时惩罚过于自信却错误的推理,从而有效平衡探索-开发trade-off。广泛的实验表明,在五个数学推理基准测试中,UCAS在包括1.5B和7B在内的多个模型规模上均显著优于强大的RLVR基线。我们的分析确认,UCAS不仅实现更高奖励,还促进了推理多样性,成功缓解了熵崩溃。代码已发布于https://github.com/xvolcano02/UCAS。

关键词

引用

@article{arxiv.2510.10649,
  title  = {Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning},
  author = {Can Xie and Ruotong Pan and Xiangyu Wu and Yunfei Zhang and Jiayi Fu and Tingting Gao and Guorui Zhou},
  journal= {arXiv preprint arXiv:2510.10649},
  year   = {2026}
}

备注

20 pages, 4 figures, ACL2026