树状分支对GRPO中思考优势估计的影响
计算与语言
2026-02-06 v3
摘要
Group Relative Policy Optimization (GRPO) 通过可验证奖励训练链式思维推理,但估计思考层次优势时若不使用价值函数往往 suffer于高方差。虽然实际应用中使用树状分支以降低方差,但缺乏对其工作原理的理论解释,亦未确定这是否重要甚至必要。我们从最小化树状分支设置(即对每个思考抽样多个答案)出发,围绕思考层次优势估计,从方差视角进行研究。使用多元微分方法,我们揭示了不同抽样维度对方差影响的非对称性:增加思考抽样次数 (K) 仅留下严格正的方差下限,而增加每个思考的答案次数 (M) 则可单调降低方差,最终使方差渐近降至零。这表明仅通过扩大思考抽样无法实现精确的思考层次优势估计,分支机制可能非人意料地成为必需机制而非启发式方法。实验进一步提供了答案级分支有效性和必要性的实证证据,表明其在数学及广泛的视觉领域中,能够实现优化稳定性、训练效率和最终性能的提升,并在不同模型架构和规模下表现出色。
引用
@article{arxiv.2509.24494,
title = {Why Tree-Style Branching Matters for Thought Advantage Estimation in GRPO},
author = {Hongcheng Wang and Yinuo Huang and Sukai Wang and Guanghui Ren and Hao Dong},
journal= {arXiv preprint arXiv:2509.24494},
year = {2026}
}
备注
Under review