通过大模型和小模型协作实现 LLM 高效推理的投机链式思维
计算与语言
2025-05-27 v2
摘要
OpenAI o1 和 Deepseek-R1 等大型推理语言模型近期因其惊人的任务解决能力而引起广泛关注。然而,这些模型的庞大规模和生成冗长思维链的过程,带来了显著的推理成本和响应延迟。现有方法主要从减少模型参数数量或缩短链式思维长度来提高效率。本文引入投机链式思维(SCoT),从加大模型协作的平均推理速度来另辟蹊径,从而降低推理延迟。SCoT 使用轻量级草稿模型进行思维层面的草拟,然后挑选最佳的 CoT 草稿,并用目标模型纠正错误案例。提出的思考行为对齐提高了草稿的效率,而草稿选择策略保持了目标模型在复杂任务中的预测准确性。实验结果表明,在 GSM8K、MATH、GaoKao、CollegeMath 和 Olympiad 数据集上,SCoT 对 Deepseek-R1-Distill-Qwen-32B 和 Deepseek-R1-Distill-Llama-70B 的推理延迟分别降低了 48%~66% 和 21%~49%,同时实现了接近目标模型水平的性能。我们的代码已公开于 https://github.com/Jikai0Wang/Speculative_CoT。
引用
@article{arxiv.2504.19095,
title = {Efficient Reasoning for LLMs through Speculative Chain-of-Thought},
author = {Jikai Wang and Juntao Li and Jianye Hou and Bowen Yan and Lijun Wu and Min Zhang},
journal= {arXiv preprint arXiv:2504.19095},
year = {2025}
}