SpeContext:通过 LLM 中的推测稀疏化实现高效长上下文推理
人工智能
2025-12-02 v1
摘要
本文指出,检索算法的目标是与LLM对齐,这与 LLM 中的知识蒸馏目标相似。我们从信息论角度分析了蒸馏语言模型(DLM)与原始 LLM 在信息聚焦方面的相似性,从而提出一种新范式:将 DLM 作为检索算法。基于此洞见,我们提出SpeContext,一种面向长上下文推理的算法与系统协同设计。(1)在算法层面,SpeContext基于 DLM 的 head 级别注意力权重提出轻量级检索头,通过剪枝消除冗余实现>90%的参数降低。(2)在系统层面,SpeContext设计了通过弹性加载策略实现的异步预取数据流,有效地将 KV 缓存检索与 LLM 计算重叠。(3)在编译层面,SpeContext构建了理论内存模型,实现自适应内存管理以最大化 GPU 内存利用率进行加速。我们在两种资源受限环境(云端和边缘)部署并评估了SpeContext。大量实验表明,与 Huggingface 框架相比,SpeContext 在云端实现最高达24.89倍的吞吐量提升,在边缘端实现10.06倍的加速,同时几乎不损失准确性,推动了准确性与吞吐量的帕累托前沿。
引用
@article{arxiv.2512.00722,
title = {SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs},
author = {Jiaming Xu and Jiayi Pan and Hanzhen Wang and Yongkang Zhou and Jiancai Ye and Yu Wang and Guohao Dai},
journal= {arXiv preprint arXiv:2512.00722},
year = {2025}
}
备注
Accepted by ASPLOS 2026