让平衡永存:基于信息瓶颈的基于树的策略优化
机器学习
2026-05-28 v1
摘要
最近的在线强化学习(RL)进展在大型语言模型(LLM)方面已显示出在复杂推理任务中取得有希望的性能。然而,它们往往表现出不平衡的探索-开发权衡,导致优化不稳定和亚最优性能。我们引入了IB-Score,这是一种基于信息瓶颈理论的新型指标,通过量化步骤级别推理多样性与正确答案之间共享的相互信息之间的权衡来评估策略的探索-开发平衡。基于IB-Score的分析显示,流行的在线RL方法(如GRPO)在常见正则化器下无法在训练期间始终维持平衡,导致次优结果。为此,我们提出了基于信息瓶颈的基于树的策略优化(IB-TPO),这是一种以IB-Score为细粒度优化目标的原则方法,利用一种新的IB引导的树形抽样策略,不仅提高了在相同token预算下50%更多轨迹的采样效率,还利用树结构进行有效的IB-Score蒙特卡罗估计。广泛的实验表明,我们的方法在GRPO基线上 outperform 2.9%至3.6%,也优于其他最先进的在线RL方法。我们的代码可在 https://github.com/alibaba/EfficientRL 获取。
引用
@article{arxiv.2605.28109,
title = {Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization},
author = {Hao Jiang and Shurui Li and Tianpeng Bu and Bowen Xu and Xin Liu and Qihua Chen and Hongtao Duan and Lulu Hu and Bin Yang and Minying Zhang},
journal= {arXiv preprint arXiv:2605.28109},
year = {2026}
}
备注
Accepted to ICML 2026 main conference