中文

推测深且准:通过替代推测解码实现卸载 LLM 的无损且无需训练的加速

计算与语言 2025-10-10 v2

摘要

大型语言模型(LLM)的庞大规模对在内存受限的消费级 GPU 上部署提出了挑战。尽管模型压缩和参数卸载是应对内存限制的常见策略,但压缩可能降低质量,而卸载虽保持质量却因推理缓慢而受限。推测解码为加速参数卸载提供了有前景的途径,它利用一个快速草稿模型提出多个草稿标记,然后由目标 LLM 通过单次前向传播并行验证。该方法减少了涉及卸载权重传输的前向传播中耗时的数据传输。现有方法通常依赖同一家族的预训练权重,但需要额外训练才能与自定义训练模型对齐。此外,涉及草稿模型训练的方法通常只能带来适度的加速。这一限制源于与目标模型的对齐不足,阻碍了更高的标记接受长度。为应对这些挑战并实现更大的加速,我们提出了 SubSpec,一种即插即用的无损且无需训练的方法,用于加速参数卸载。SubSpec 通过从卸载的目标 LLM 部分生成低位量化替代层来构建高度对齐的草稿模型。此外,我们的方法共享剩余的 GPU 驻留层和 KV-Cache,进一步减少内存开销并增强对齐。SubSpec 实现了高平均接受长度,在 MT-Bench 上为 Qwen2.5 7B(8GB VRAM 限制)提供 9.1 倍加速,在热门生成基准测试上为 Qwen2.5 32B(24GB VRAM 限制)提供平均 12.5 倍加速。

关键词

引用

@article{arxiv.2509.18344,
  title  = {Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding},
  author = {Pei-Shuo Wang and Jian-Jia Chen and Chun-Che Yang and Chi-Chih Chang and Ning-Chi Huang and Mohamed S. Abdelfattah and Kai-Chiang Wu},
  journal= {arXiv preprint arXiv:2509.18344},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025