层次预算策略优化用于自适应推理
人工智能
2025-08-08 v3 计算与语言
摘要
大型推理模型通过大量链式思考生成实现了显著性能,但存在一个关键效率问题:无论问题复杂度如何,都施加统一的密集推理。我们提出层次预算策略优化 (HBPO),一种强化学习框架,使模型能够在不牺牲能力的前提下学习问题特定的推理深度。不同于现有方法施加刚性约束或依赖离散模式选择,HBPO 将探索空间划分为预算受限的层次结构 (512-2560 token),每个层次具有不同的奖励结构,以保留效率激励和推理能力。该设计解决了高效推理训练中的根本挑战:传统长度惩罚系统性地偏向模型远离必要的长推理路径,导致探索空间塌陷。通过层次抽样和预算感知奖励,HBPO 保持探索多样性,同时教导模型识别延长推理是否值得。大量实验表明,HBPO 在四个推理基准中将平均 token 使用量降低最高可达 60.6%,同时将准确率提高 3.14%。最显著的是,HBPO 表现出一种新兴的自适应行为,即模型会根据问题复杂度自动调整推理深度。我们的结果表明,推理效率与能力并非天然冲突,through 适当构建的分层训练可以同时优化这两者,而无需牺牲探索多样性。
引用
@article{arxiv.2507.15844,
title = {Hierarchical Budget Policy Optimization for Adaptive Reasoning},
author = {Shangke Lyu and Linjuan Wu and Yuchen Yan and Xingyu Wu and Hao Li and Yongliang Shen and Peisheng Jiang and Weiming Lu and Jun Xiao and Yueting Zhuang},
journal= {arXiv preprint arXiv:2507.15844},
year = {2025}
}
备注
Code: https://github.com/zju-real/hbpo Project Page:https://zju-real.github.io/hbpo/