CAS-Spec: 基于级联自适应自推测解码的 LLM 无损推理加速
机器学习
2025-11-03 v1 人工智能
摘要
推测解码(Speculative decoding)已成为大语言模型(LLM)部署中无损推理加速的广泛采用的有效技术。虽然基于自推测的即时方法易于集成且应用广泛,但往往难以实现依赖专业训练方法所达到的速度提升。级联多个草稿模型(draft models)的层级结构虽可进一步加速并提供灵活性,但由于训练多个模型成本高昂,限制了其实际应用。在本文中,我们提出一种新型级联自适应自推测解码方法(CAS-Spec),通过利用动态可切换推理加速(DSIA)策略构建推测草稿模型,包括层稀疏和激活量化。此外,传统的垂直和水平级联算法在应用自推测解码方法时效率不高。我们引入一种动态树级联(DyTC)算法,基于接受率和延迟预测的启发式,自适应路由多级草稿模型并分配草稿长度。我们的 CAS-Spec 方法在各种 LLM 和数据集上实现了与现有即时推测解码方法相比的业界领先的加速,平均加速度从 提升至 。DyTC 相对于基于级联的基线和基于树的基线算法分别提高了平均加速度的 47% 和 48%。CAS-Spec 可轻松集成到大多数现有 LLM 中,并在自推测解码技术不断演进时具有进一步加速的潜力。
引用
@article{arxiv.2510.26843,
title = {CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs},
author = {Zhiyuan Ning and Jiawei Shao and Ruge Xu and Xinfei Guo and Jun Zhang and Chi Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2510.26843},
year = {2025}
}
备注
10 pages, 3 figures, NeurIPS 2025 poster