并非所有思维都需要HBM:面向LLM推理的语义感知内存层次结构
摘要
推理 LLM 会产生数千个思维链 token,其 KV cache 必须驻留在稀缺的 GPU HBM 中。主流应对策略——永久驱逐低重要性 token——对推理是灾难性的:当移除一半缓存时,准确率骤降至 0-2.5%。我们提出了一个不同的问题:是否每个 token 都必须驻留在 HBM 中,还是某些 token 可以驻留在其他地方?我们引入了一种语义感知的内存层次结构,该结构使用累积注意力评分将 token 划分为四个层级——HBM、DDR、压缩和驱逐。低重要性 token 被移动到 CPU 内存而不是被销毁;在每个注意力步骤之前,它们以全精度被预取回,贡献的项与它们从未离开 GPU 时完全相同。我们将此形式化为零近似误差卸载,并推导出我们的核心发现:准确率仅取决于永久丢弃的 token 数量(驱逐比例),而不取决于保留在 HBM 中的 token 数量。在 HBM 和驱逐比例上进行的受控 3x3 网格实验在三个模型规模(7B-32B)和四个基准测试上证实了这一点。在仅 3% 驱逐率的情况下,该层次结构在 GSM8K 上保留了 91% 的全缓存准确率,在 MATH-500 上保留了 71%(n=200);在 14B 规模下,它匹配了未压缩基线(90% 对 86%),同时将 HBM 占用减半。在我们的设置上对当前 SOTA 驱逐方法 R-KV 的正面复现,在可比预算下仅达到 0-32%。具有真实 GPU-CPU 数据移动的系统原型表明,这种保留的代价是适度的——5-7% 的传输开销——并且扩展分析预计在生产批次大小下可节省 2-48 GB 的 HBM。
引用
@article{arxiv.2605.09490,
title = {Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning},
author = {Aojie Yuan and Tianqi Shen and Dajun Zhang},
journal= {arXiv preprint arXiv:2605.09490},
year = {2026}
}
备注
Preprint. 14 pages + appendix. Under review at AdaptFM Workshop @ ICML 2026