QuickSilver -- 通过动态令牌停止、KV 跳过、情境令牌融合和自适应森屿量化加速 LLM 推理
计算与语言
2025-06-30 v1 人工智能
摘要
推理在大型语言模型(LLM)部署中占据绝大多数延迟和能耗,常常超过总体成本的90%。虽然训练时间的效率取得了显著进展,但在自回归解码下,运行时优化仍是关键瓶颈。现有方法——如剪枝、量化、提前退出和投机解码——常常需要重新训练、修改模型架构或干扰解码兼容性。我们引入 QuickSilver,一个模块化的、基于令牌级别的框架,使推理时能够实现语义适应性,而无需更改模型权重或结构。QuickSilver 集成了四种协同机制:(i) 动态令牌停止,对已收敛表示的令牌停止计算;(ii) KV 缓存跳过,选择性抑制内存写入以减少注意力开销;(iii) 情境令牌融合,将冗余令牌折叠到共享路径上以缩短序列长度。与投机解码或混合专家路由不同,QuickSilver 完全针对冻结的稠密模型工作,不需要额外网络。应用于 GPT-2 和 Llama-2 以及 WikiText-103 和 C4 数据集,QuickSilver 实现了最高可达39.6%的 FLOP 降低,同时保持可接受的困惑度 degradation(<=0.2)。
引用
@article{arxiv.2506.22396,
title = {QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization},
author = {Danush Khanna and Aditya Kumar Guru and Srivarshinee Sridhar and Zidan Ahmed and Rubhav Bahirwani and Meetu Malhotra and Vinija Jain and Aman Chadha and Amitava Das and Kripabandhu Ghosh},
journal= {arXiv preprint arXiv:2506.22396},
year = {2025}
}
备注
Preprint. Under submission