中文

通过大模型和小模型协作实现 LLM 高效推理的投机链式思维

计算与语言 2025-05-27 v2

摘要

OpenAI o1 和 Deepseek-R1 等大型推理语言模型近期因其惊人的任务解决能力而引起广泛关注。然而,这些模型的庞大规模和生成冗长思维链的过程,带来了显著的推理成本和响应延迟。现有方法主要从减少模型参数数量或缩短链式思维长度来提高效率。本文引入投机链式思维(SCoT),从加大模型协作的平均推理速度来另辟蹊径,从而降低推理延迟。SCoT 使用轻量级草稿模型进行思维层面的草拟,然后挑选最佳的 CoT 草稿,并用目标模型纠正错误案例。提出的思考行为对齐提高了草稿的效率,而草稿选择策略保持了目标模型在复杂任务中的预测准确性。实验结果表明,在 GSM8K、MATH、GaoKao、CollegeMath 和 Olympiad 数据集上,SCoT 对 Deepseek-R1-Distill-Qwen-32B 和 Deepseek-R1-Distill-Llama-70B 的推理延迟分别降低了 48%~66% 和 21%~49%,同时实现了接近目标模型水平的性能。我们的代码已公开于 https://github.com/Jikai0Wang/Speculative_CoT。

关键词

引用

@article{arxiv.2504.19095,
  title  = {Efficient Reasoning for LLMs through Speculative Chain-of-Thought},
  author = {Jikai Wang and Juntao Li and Jianye Hou and Bowen Yan and Lijun Wu and Min Zhang},
  journal= {arXiv preprint arXiv:2504.19095},
  year   = {2025}
}