自注意力模块中巨大值是理解语境知识的关键
计算与语言
2025-05-22 v4
摘要
大型语言模型 (LLM) 在语境知识理解方面取得了显著的成功。本文我们表明,这些集中化的巨大值在注意力查询 (Q) 和键 (K) 的特定区域持续出现,而在值 (V) 中则没有此类模式。通过大量实验,我们进一步证明,这些巨大值在解释来自当前语境窗口获取的知识(即语境知识)方面发挥关键作用,而不在检索模型参数内部存储的参数知识方面发挥作用。我们进一步对量化策略进行探索,发现忽略这些巨大值会导致在需要丰富语境理解的任务上性能显著下降,与我们的分析相吻合。最后,我们追踪了集中化巨大值的出现,发现这种集中化是由旋转位置编码 (RoPE) 导致的,该编码自最初的层起就出现了。这些发现为我们提供了关于 Q 和 K 在 LLM 中如何运作的新视角,并为模型设计和优化提供了实用见解。代码已公开:https://github.com/MingyuJ666/Rope_with_LLM。
引用
@article{arxiv.2502.01563,
title = {Massive Values in Self-Attention Modules are the Key to Contextual Knowledge Understanding},
author = {Mingyu Jin and Kai Mei and Wujiang Xu and Mingjie Sun and Ruixiang Tang and Mengnan Du and Zirui Liu and Yongfeng Zhang},
journal= {arXiv preprint arXiv:2502.01563},
year = {2025}
}
备注
International Conference on Machine Learning (ICML 2025)