中文

基于结果引导的弹性信任区域:用于策略优化的ETR

机器学习 2026-01-08 v1

摘要

基于可验证奖励的强化学习(RLVR)已成为释放大型语言模型推理能力的重要范式,以OpenAI o1和DeepSeek-R1为例。当前,基于组相对策略优化(GRPO)是该领域的主导算法,由于其稳定训练和无评论家的高效性。然而,我们认为GRPO存在结构性局限:它在所有样本上施加统一、静态的信任区域约束。这一设计隐含地假设信号均匀性,与结果驱动学习中信号质量异构性的事实不符,其中优势大小和方差会显著波动。因此,静态约束无法充分发挥高质量信号的潜力,同时不足以抑制噪声,常导致快速的熵崩溃。为此,我们提出了弹性信任区域(ETR),一种动态机制,使优化约束与信号质量相匹配。ETR通过双层弹性构建信号感知的 landscapes:在微观层面,它根据优势大小缩放裁剪边界以加快来自高置信度路径的学习;在宏观层面,它利用组方差在隐式地为处于最优学习区的任务分配更大的更新预算。对AIME和MATH基准进行的大量实验表明,ETR consistently优于GRPO,在实现卓越准确率的同时,有效缓解了策略熵退化,确保持续的探索。

关键词

引用

@article{arxiv.2601.03723,
  title  = {ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization},
  author = {Shijie Zhang and Kevin Zhang and Zheyuan Gu and Xiang Guo and Rujun Guo and Shaoyu Liu and Guanjun Jiang and Xiaozhao Wang},
  journal= {arXiv preprint arXiv:2601.03723},
  year   = {2026}
}