事务性注意力:KV缓存保留的语义赞助机制
计算与语言
2026-04-14 v1 机器学习
摘要
在K=16个token(4K上下文的0.4%)时,所有现有的KV缓存压缩方法在凭证检索上的准确率均为0%。失败模式是休眠token:凭证、API密钥和配置值,这些token在生成时变得至关重要,但接收到的注意力接近零。由于这些token缺乏驱逐策略所依赖的统计信号,基于注意力分数、重建损失或学习到的保留门控的方法都无法保留它们。我们引入了事务性注意力,一种赞助机制,其中结构性的锚定模式(例如,“key:”、“password:”)保护相邻的承载值的token免于被驱逐。TA在K=16时实现了100%的凭证检索,而六个基线方法(H2O、TOVA、SnapKV、StreamingLLM、PyramidKV、DynamicKV)的准确率为0%,并在200次函数调用试验中保持了100%的准确率。TA-Fast是一种无注意力的变体,可将内存开销降低52%,并与SDPA和FlashAttention兼容。TA与现有压缩方法正交,且延迟开销增加不到1%。
引用
@article{arxiv.2604.11288,
title = {Transactional Attention: Semantic Sponsorship for KV-Cache Retention},
author = {Abhinaba Basu},
journal= {arXiv preprint arXiv:2604.11288},
year = {2026}
}