中文

SPA-Cache:面向扩散语言模型的奇点代理自适应缓存

机器学习 2026-05-26 v2 人工智能

摘要

扩散语言模型(Diffusion Language Models, DLMs)提供了一种灵活的、任意顺序的自回归范式替代方案,但其非因果性质使得标准键值缓存无法适用,迫使在每一步解码时都需要进行代价高昂的隐藏状态重计算。现有的DLM缓存方法通过选择性隐藏状态更新来降低这一成本,但仍受限于(i)代价高昂的逐token更新识别启发式方法,和(ii)僵化、统一的预算分配,无法考虑异构的隐藏状态动力学。为此,我们提出SPA-Cache,通过联合优化DLM缓存中的更新识别和预算分配来应对上述挑战。首先,我们推导了一种低维奇点代理,使能够在低维子空间中识别更新关键token,从而大幅降低更新识别的开销。其次,我们引入一种自适应策略,对稳定层分配较少的更新,而不影响生成质量。通过上述贡献,SPA-Cache显著提升了DLM的效率,相较于原始解码可实现最高8倍的吞吐量提升,相较于现有缓存基线实现2--4倍的加速。

关键词

引用

@article{arxiv.2602.02544,
  title  = {SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models},
  author = {Wenhao Sun and Rong-Cheng Tu and Yifu Ding and Zhao Jin and Jingyi Liao and Yongcheng Jing and Dacheng Tao},
  journal= {arXiv preprint arXiv:2602.02544},
  year   = {2026}
}

备注

Accepted by ICML 2026.The code repository is available at https://github.com/wenhao728/spa-cache