通过强化学习提升预算强制在大语言模型中数学推理准确率与效率
人工智能
2025-10-27 v1
摘要
测试时扩展方法因其计算效率和与参数无关的训练方式,日益受到关注,以提高大语言模型上的推理性能。其中一种方法称为预算强制(budget forcing),这是一种解码干预策略,为思考分配额外的计算资源,并发掘模型内在的自我纠错行为。然而,这依赖于在长上下文推理轨迹上的监督微调(SFT),会导致小模型因响应冗长而出现性能下降。为此,我们提供了一个集成强化学习(RL)的框架,用于提高 token 效率并提升 1.5B 参数模型在数学推理方面的性能。我们仅使用 1.5K 训练样本进行演示,发现我们的 SFT+RL 模型在不同计算预算下均在 GSM8K 数据集上表现更佳。我们的主要发现表明,整体准确率提高,同时显著减少其 token 使用量,降低了超过 40%,揭示了强化学习如何恢复长上下文训练所带来的损失,进而提升数学推理中的整体性能。
引用
@article{arxiv.2510.21398,
title = {Boosting Accuracy and Efficiency of Budget Forcing in LLMs via Reinforcement Learning for Mathematical Reasoning},
author = {Ravindra Aribowo Tarunokusumo and Rafael Fernandes Cunha},
journal= {arXiv preprint arXiv:2510.21398},
year = {2025}
}
备注
Submitted to the European Conference on Artificial Intelligence (ECAI)