中文

利用树结构进行 RL 训练中 LLM 的信用分配

计算与语言 2025-10-06 v2

摘要

强化学习改善了 LLM 的推理能力,但稀疏延迟奖励使得标记级信用分配成为瓶颈。我们研究了可验证奖励情形,即最终答案是可检查的,并且可以为每个提示生成多个响应。数学和医学 QA 中的推理任务符合这一设置,即只有少数决策标记显著影响结果。PPO 采用学习价值模型提供标记级优势,但同时训练演员和批评模型复杂且难以泛化,因为批评模型提供的标记级价值可能导致过拟合。GRPO 无需批评模型且支持可验证奖励,但将单个序列级收益在标记之间稀释,忽略了分支问题。我们引入了前缀到树 (Prefix-to-Tree, P2T) 方法,将一组响应转换为前缀树,并通过聚合后代结果计算非参数前缀值 V(s)。基于 P2T,我们提出了 TEMPO (Tree-Estimated Mean Prefix Value for Policy Optimization),即一种无需批评模型的算法,将 GRPO 对组相对结果信号增强为来自树的分支门控时序差分校正。在非分支标记上,时序差分 (TD) 项为零,因此 TEMPO 简化为 GRPO;在分支标记上,它提供精确的标记级信用,而无需学习价值网络或额外的裁判/教师。在 Qwen3-1.7B/4B 上,TEMPO 在分布内 (MATH, MedQA) 和分布外 (GSM-HARD, AMC23, MedMCQA, MMLU-Medical) 基准测试中均优于 PPO 和 GRPO,并且以大致相同的 wall-clock 时间达到更高的验证准确率。

关键词

引用

@article{arxiv.2509.18314,
  title  = {Exploiting Tree Structure for Credit Assignment in RL Training of LLMs},
  author = {Hieu Tran and Zonghai Yao and Hong Yu},
  journal= {arXiv preprint arXiv:2509.18314},
  year   = {2025}
}

备注

15 pages