投机性思考:推理时利用大模型指导增强小模型推理能力
计算与语言
2025-04-18 v1 人工智能
摘要
最近的进展利用后训练来提升模型推理性能,但这通常需要昂贵的训练流程,并且仍然存在输出低效、过于冗长的问题。我们引入了投机性思考(Speculative Thinking),这是一个无需训练的框架,能够在推理层面让大型推理模型指导较小的模型,这不同于在词元层面操作的投机解码。我们的方法基于两个观察:(1)诸如“wait”等支持推理的词元经常出现在“\n\n”等结构分隔符之后,作为反思或继续的信号;(2)较大的模型对反思行为具有更强的控制力,能减少不必要的回溯,同时提高推理质量。通过策略性地将反思步骤委托给能力更强的模型,我们的方法显著提高了推理模型的推理准确性,同时缩短了其输出。在 32B 推理模型的辅助下,1.5B 模型在 MATH500 上的准确率从 83.2% 提升至 89.4%,实现了 6.2% 的显著提升。同时,平均输出长度从 5439 个词元减少到 4583 个词元,减少了 15.7%。此外,当应用于非推理模型(Qwen-2.5-7B-Instruct)时,我们的框架在同一基准上将其准确率从 74.0% 提升至 81.8%,实现了 7.8% 的相对提升。
引用
@article{arxiv.2504.12329,
title = {Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time},
author = {Wang Yang and Xiang Yue and Vipin Chaudhary and Xiaotian Han},
journal= {arXiv preprint arXiv:2504.12329},
year = {2025}
}