中文

基于预算相对策略优化的即时推理优化

机器学习 2025-11-10 v3 人工智能 计算与语言

摘要

扩大测试时计算量对于增强大型语言模型(LLM)的推理能力至关重要。现有方法通常采用强化学习(RL)以在推理轨迹结束时获得的可验证奖励为目标,从而最大化性能。然而,这些方法仅在大型固定token预算下优化最终性能,限制了训练和部署中的效率。在本工作中,我们提出了一种新框架AnytimeReasoner,以优化即时推理性能,旨在提高token效率并实现在各种token预算约束下的推理灵活性。为实现此目标,我们将完整的思考过程截断以适应来自先验分布的抽样token预算,迫使模型为每个被截断的思考过程进行最优答案总结以进行验证。这将可验证的稠密奖励引入推理过程,从而促进RL优化中的更有效信用分配。我们随后以解耦方式优化思考和总结策略,以最大化累积奖励。此外,我们引入了一种新型方差归约技术,即预算相对策略优化(BRPO),以增强在强化思考策略时学习过程的鲁棒性和效率。在数学推理任务中的实证结果表明,我们的方法在各种先验分布下的所有思考预算下均一致优于GRPO,显著提升了训练和token效率。

关键词

引用

@article{arxiv.2505.13438,
  title  = {Optimizing Anytime Reasoning via Budget Relative Policy Optimization},
  author = {Penghui Qi and Zichen Liu and Tianyu Pang and Chao Du and Wee Sun Lee and Min Lin},
  journal= {arXiv preprint arXiv:2505.13438},
  year   = {2025}
}