START:自学带工具的推理器
摘要
大型推理模型(LRMs)如 OpenAI-o1 和 DeepSeek-R1 通过利用长链式思维(CoT)在复杂推理任务中展现出惊人的能力,但这些模型常因仅依赖内部推理过程而出现幻觉和效率低下。本文引入 START(Self-Taught Reasoner with Tools),一种集成外部工具的自推理长 CoT LLM,通过利用代码执行显著提升推理能力,能够进行复杂计算、自我检查、探索多种方法和自我调试,从而克服 LRMs 的局限。START 的核心创新在于其自学习框架,包含两个关键技术:1)Hint-infer:我们展示在 LRM 推理过程中插入人工设计的提示(如 "Wait, maybe using Python here is a good idea.")可有效激发其利用外部工具的能力,无需 demonstration 数据。Hint-infer 还可作为简单且高效的顺序测试时间扩展方法;2)Hint Rejection Sampling Fine-Tuning(Hint-RFT):Hint-RFT 将 Hint-infer 与 RFT 结合,通过对 LRM 通过 Hint-infer 生成的带工具调用推理轨迹进行评分、筛选和修改,然后进行微调。通过该框架,我们对 QwQ-32B 模型进行了微调以实现 START。在 PhD 水平科学问答(GPQA)、竞赛级数学基准(AMC23、AIME24、AIME25)和竞赛级代码基准(LiveCodeBench)上,START 分别达到 63.6%、95.0%、66.7%、47.1% 和 47.3% 的准确率。显著优于基础 QwQ-32B,并与最先进的开源权重模型 R1-Distill-Qwen-32B 以及专有模型 o1-Preview 性能相当。
引用
@article{arxiv.2503.04625,
title = {START: Self-taught Reasoner with Tools},
author = {Chengpeng Li and Mingfeng Xue and Zhenru Zhang and Jiaxi Yang and Beichen Zhang and Xiang Wang and Bowen Yu and Binyuan Hui and Junyang Lin and Dayiheng Liu},
journal= {arXiv preprint arXiv:2503.04625},
year = {2025}
}
备注
38 pages, 5 figures and 6 tables