中文

SpecExit: 通过推测性退出加速大型推理模型

人工智能 2025-10-22 v2 计算与语言 机器学习

摘要

尽管大型推理模型(LRMs)在推理任务上表现强劲,但它们常常过度思考,产生不必要的冗长输出并导致高端到端延迟,这严重限制了其实际部署。为解决过度思考问题,早退机制被提出用于在通常完成之前终止推理,表明该方法可以在对准确性影响最小的情况下有效缩短生成长度。然而,它们对探测机制的依赖引入了检测开销,限制了端到端延迟收益,并损害了其在不同问题上的泛化能力。受推测解码中隐状态的启发,我们提出 SpecExit,一个新颖框架,通过轻量级草稿模型直接预测未来标记和早退信号,无需探测开销。我们的方法带来了显著改进,与推测解码基线相比,平均生成长度减少 66%,端到端延迟实现 2.5 倍加速,且未损害准确性。我们的方法利用隐状态中固有的信号来提供有效的早退信号,暗示了隐状态在高效推理中的更广泛应用。代码可在 https://github.com/Tencent/AngelSlim 获取。

关键词

引用

@article{arxiv.2509.24248,
  title  = {SpecExit: Accelerating Large Reasoning Model via Speculative Exit},
  author = {Rubing Yang and Huajun Bai and Song Liu and Guanghua Yu and Runzhi Fan and Yanbin Dang and Jiejing Zhang and Kai Liu and Jianchen Zhu and Peng Chen},
  journal= {arXiv preprint arXiv:2509.24248},
  year   = {2025}
}