中文

双阶段决策抽样假设:理解 RL 训练大语言模型自我反思的生成机制

机器学习 2026-04-13 v2 人工智能

摘要

自我反思能力在大型语言模型(LLM)经过 RL 训练后涌现,多轮 RL 相较于 SFT 取得显著提升。然而,统一优化目标如何产生生成解决方案和评估何时需要修订的功能性不同能力仍不清晰。为此,我们引入梯度归因属性来刻画奖励梯度在策略组件中的分布,通过双阶段决策抽样(DS)假设形式化,将策略分为用于生成的抽样(πsample\pi_{sample})和用于验证的决策(πd\pi_{d})。我们证明,代理奖励表现出平衡的梯度归因,而 SFT 和 KL 惩罚表现出不平衡的梯度归因,长度加权导致对πsample\pi_{sample} 的约束而πd\pi_{d} 未被充分优化,从而提供了 RL 为何在 SFT 上失败的理论解释。我们还在算术推理任务上实证验证了理论预测,RL 的优越泛化性主要来自决策能力(πd\pi_{d})的提升而非抽样能力的提升,为思考模型的自我纠正提供了首要原理的机制解释。

关键词

引用

@article{arxiv.2601.01580,
  title  = {The Two-Stage Decision-Sampling Hypothesis: Understanding the Emergence of Self-Reflection in RL-Trained LLMs},
  author = {Zibo Zhao and Yuanting Zha and Haipeng Zhang and Xingcheng Xu},
  journal= {arXiv preprint arXiv:2601.01580},
  year   = {2026}
}