KV 缓存中注意力得分并非唯一的 token 重要性指示器:值也很重要
计算与语言
2024-10-03 v2 机器学习
摘要
扩大大型语言模型 (LLM) 的上下文大小使其能够执行各种新任务,例如书籍摘要。然而,注意力中键和值 (KV) 缓存的内存成本显著限制了 LLM 的实际应用。最近的研究探索了用于 KV 缓存减少的 token 剪枝,仅依赖注意力得分作为 token 重要性指示器。然而,我们对值向量范数进行的调查揭示了显著的非均匀模式,质疑其仅依赖注意力得分。灵感来自这一发现,我们提出了一种新方法:价值感知 token 剪枝 (VATP),它使用注意力得分和值向量的 范数来评估 token 重要性。在 LLaMA2-7B-chat 和 Vicuna-v1.5-7B 上进行的 16 个 LongBench 任务的广泛实验表明,VATP 在超过 12 个任务中超过了仅使用注意力得分的基线,确认了将值向量范数纳入 LLM token 重要性评估的有效性。
引用
@article{arxiv.2406.12335,
title = {Attention Score is not All You Need for Token Importance Indicator in KV Cache Reduction: Value Also Matters},
author = {Zhiyu Guo and Hidetaka Kamigaito and Taro Watanabe},
journal= {arXiv preprint arXiv:2406.12335},
year = {2024}
}
备注
Accepted at EMNLP 2024 (Main)