中文

强化学习中基于条件的优势估计:用于大规模推理模型

人工智能 2025-09-30 v1 计算与语言

摘要

针对大型语言模型(LLM)的强化学习可验证奖励(RLVR)在具有明确正确性标准的任务(如数学推理任务)上已取得显著进展。几项训练指标(如熵或响应长度)被观察到与强化学习中不同推理行为相关。以往方法通过奖励或优势塑形纳入此类先验,通常依赖人工设计的惩罚和偏好(例如更高更好或更低更好)。然而,在没有仔细调参的情况下,这些方向性先验可能过度偏斜,导致失败。为此,我们引入条件优势估计(CANON),放大目标指标的影响,而无需预先假设其方向。具体而言,CANON 将抽样响应分为两组(基于目标指标的更高或更低值),通过组间比较测量哪种指标趋势有助于更好性能,并在同一组内识别更佳响应。总之,基于熵的 CANON 在三个 LLM 上在数学推理和高复杂度逻辑任务上均优于先前方法。应用于响应长度时,CANON 进一步提高了 token 效率,在性能成本权衡的帕累托前沿方面表现更佳。

关键词

引用

@article{arxiv.2509.23962,
  title  = {Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models},
  author = {Guanxu Chen and Yafu Li and Yuxian Jiang and Chen Qian and Qihan Ren and Jingyi Yang and Yu Cheng and Dongrui Liu and Jing Shao},
  journal= {arXiv preprint arXiv:2509.23962},
  year   = {2025}
}

备注

18 pages, 13 figures, 4 tables