SpecReason:基于推测推理的快速准确推理时计算
机器学习
2025-05-20 v2 人工智能
摘要
推理时计算的最新进展通过使用大型推理模型(LRM)生成长思维链显著提升了复杂任务上的性能。然而,由于生成的推理序列较长以及解码的自回归特性,这种准确性的提升是以高推理延迟为代价的。我们应对这些开销的关键见解是,LRM 推理及其所嵌入的推理对近似高度容忍:复杂任务通常被分解为更简单的步骤,每个步骤的效用基于其为下游步骤提供的语义见解,而非其生成的精确 token。因此,我们引入了 SpecReason,这是一个通过使用轻量级模型(推测性地)执行更简单的中间推理步骤,并仅保留昂贵的基础模型来评估(并可能纠正)推测输出,从而自动加速 LRM 推理的系统。重要的是,SpecReason 专注于利用思维 token 的语义灵活性来保持最终答案的准确性,这与先前的推测技术(最显著的是推测解码,后者要求每一步在 token 级别上等价)是互补的。在各种推理基准测试中,SpecReason 相比原始 LRM 推理实现了 的加速,同时准确性提高了 。与不含 SpecReason 的推测解码相比,两者的结合产生了额外的 延迟降低。我们在 https://github.com/ruipeterpan/specreason 开源了 SpecReason。
引用
@article{arxiv.2504.07891,
title = {SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning},
author = {Rui Pan and Yinwei Dai and Zhihao Zhang and Gabriele Oliaro and Zhihao Jia and Ravi Netravali},
journal= {arXiv preprint arXiv:2504.07891},
year = {2025}
}