KVSink:理解和增强 LLM KV 缓存量化中注意力沉阱的保护
计算与语言
2025-08-07 v1
摘要
键值(KV)缓存量化已成为高效大语言模型(LLM)推理中广泛采用的优化技术,通过减少KV缓存内存使用来缓解内存受限约束。近期研究强调,保留前几个token的原始KV精度对于确保注意力沉阱的保护至关重要。虽然这种方法在缓解性能下降方面证明有效,但其背后的原理仍不充分理解。此外,它未能解决注意力沉阱可出现在初始token位置之外的最新发现。本文通过考察注意力沉阱在跨层极端激活异常演化中的作用,阐明了注意力沉阱推断过程中的底层机制。我们对注意力沉阱与KV缓存量化之间的相互作用进行了全面分析。基于我们的深入理解,我们提出了\textit{\textbf{KVSink}},一种一种可预测沉阱token、开销可忽略的插拔式方法,有效实现注意力沉阱的更全面保护。大量实验表明,KVSink 在保护注意力沉阱方面优于现有的保留前N个token(PFN)策略,进一步地,当应用于 established KVQuant 方法时,KVSink 还能提高 perplexity(PPL)并减少对16位数值异常值的依赖。
引用
@article{arxiv.2508.04257,
title = {KVSink: Understanding and Enhancing the Preservation of Attention Sinks in KV Cache Quantization for LLMs},
author = {Zunhai Su and Kehong Yuan},
journal= {arXiv preprint arXiv:2508.04257},
year = {2025}
}
备注
Published as a conference paper at COLM 2025