用工具使用替代思考使小语言模型具备推理能力
机器学习
2025-07-08 v1 人工智能
摘要
最近的进展建立了一种新的机器学习范式,该范式基于在推理时间和训练时间上同时扩展计算量。在这一系列工作中,结合对合成演示的监督微调(SFT)和带可验证奖励的强化学习(RLVR),用于训练大型语言模型在推理过程中以自然语言表达的“思考”形式消耗额外的计算资源。在本文中,我们提出将这些令牌格式化为与有状态工具的多轮交互轨迹。在每一轮中,工具的新状态被附加到模型的上下文中,模型的任务是通过自定义领域特定语言(DSL)生成控制工具所需的令牌。我们在修复故障Python代码的问题上对该方法进行了基准测试,并表明这种受约束的设置允许更快的经验采样和更密集的奖励信号,使得即使是参数规模高达3B的模型也能学会熟练地在该任务上消耗额外的计算资源。
引用
@article{arxiv.2507.05065,
title = {Replacing thinking with tool usage enables reasoning in small language models},
author = {Corrado Rainone and Tim Bakker and Roland Memisevic},
journal= {arXiv preprint arXiv:2507.05065},
year = {2025}
}
备注
23 pages, includes appendix