中文

仅名为 RL?对 LLMs 后训练中结构假设的分析

机器学习 2026-02-05 v4 人工智能

摘要

基于强化学习的大语言模型(LLM)后训练方法近期受到关注,尤其是 DeepSeek R1 采用 GRPO 进行微调后。尽管围绕 RL 后训练提升推理能力的声称日益增长,但我们对这些方法的表述和假设进行批判性审视。我们首先指出建模 LLM 训练为 MDP 所做的流行结构假设,并展示了这些假设如何导致退化的 MDP,将问题特征为情境型多臂老带 arm(contextual bandit),其中 RL 更新自然坍缩为基于结果的监督学习的一种 on-policy 变体。两个关键结构假设包括:(1)将 MDP 状态仅限于动作与状态的拼接,使得状态成为上下文窗口,动作成为 LLM 中的标记;(2)将状态-动作轨迹的奖励在轨迹上均匀分配。我们的全面分析表明,由于这些简化假设,GRPO 目标简化为过滤的迭代 SFT(Filtered Iterative SFT),即一种 on-policy 的监督微调变体。我们在包括 GSM8K 和 Countdown 在内的多个基准测试上进行实验,覆盖多样的模型家族,表明过滤的迭代 SFT(纳入正负样本)的性能与 GRPO 基于训练相当。我们还表明,这些结构假设间接激励 RL 生成更长的中间标记序列,从而强化了“RL 激励思考因其生成更长的思考痕迹”的叙事。

关键词

引用

@article{arxiv.2505.13697,
  title  = {RL in Name Only? Analyzing the Structural Assumptions in RL post-training for LLMs},
  author = {Soumya Rani Samineni and Durgesh Kalwar and Karthik Valmeekam and Kaya Stechly and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2505.13697},
  year   = {2026}
}