TreeAdv:基于树结构的群体强度再分配用于基于群体的强化学习
机器学习
2026-04-10 v2 人工智能
摘要
基于群体目标的强化学习,如群体相对策略优化(GRPO),是对复杂推理任务进行大型语言模型对齐的常见框架。然而,标准 GRPO 将每个 rollout 轨迹视为独立的平坦序列,为所有 token 分配单个序列级强度,导致样本效率低下,并对冗长且冗余的思考链路产生长度偏好,而未能提升逻辑深度。我们提出 TreeAdv(Tree-Structured Advantage Redistribution for Group-Based RL),使群体 rollout 的树结构在探索和强度分配中显式化。具体而言,TreeAdv 基于熵驱动的采样方法构建群体(森林),在高不确定性决策处进行分支,而在低不确定性 token 之间共享。随后,TreeAdv 通过重新分配完整 rollout(所有叶节点)的强度,聚合内部树段的 token 级强度。TreeAdv 可轻松应用于如 GRPO 或 GSPO 等群体目标。跨 10 个数学推理基准测试,TreeAdv 在相同监督、数据和解码预算下, consistently 优于 GRPO 和 GSPO,同时显著减少生成的 token 数量。
引用
@article{arxiv.2601.03703,
title = {TreeAdv: Tree-Structured Advantage Redistribution for Group-Based RL},
author = {Lang Cao and Hui Ruan and Yongqian Li and Peng Chao and Wu Ning and Haonan Song and Renhong Chen and Yitong Li},
journal= {arXiv preprint arXiv:2601.03703},
year = {2026}
}