Nectar: 基于回归的缓存 Token 注意力神经估计
机器学习
2026-05-12 v1 计算与语言
摘要
在固定的长上下文上评估 softmax 注意力,需要为每个新的查询 token 读取每一个缓存的键值对。对于给定的上下文(一本书、一本手册、一个法律语料库),注意力输出是查询的确定性函数。我们提出了 Nectar,它为从任务相关分布中提取的查询拟合一个紧凑的神经网络来逼近该函数。Nectar 为每层和每个 KV 头拟合两个网络:一个预测注意力输出的目标网络和一个预测对数归一化因子的评分网络。这对网络在推理时插入标准的掩码自注意力中,用前向传播取代对缓存的 注意力计算,且其成本不依赖于 。每个模块在每层和每个 KV 头上携带约 个参数,通常远小于同等粒度下 的 KV 缓存占用。我们报告了在 1.7B 到 8B 参数模型上跨五个长上下文数据集的实验。近似误差与全注意力的下一个 token 准确率差距相对应,而在我们的消融研究中,跨层非均匀分配容量可减小该差距。除了对指标的这一分析外,我们还验证了配备 Nectar 模块的模型生成的文本(在回答问题提示后)在语义内容上与让同一模型访问完整缓存所获得的结果相匹配。
引用
@article{arxiv.2605.09778,
title = {Nectar: Neural Estimation of Cached-Token Attention via Regression},
author = {João Monteiro and Michal Klein and Pierre Ablin and Marco Cuturi},
journal= {arXiv preprint arXiv:2605.09778},
year = {2026}
}