中文

多头注意力中标记选择的几何分析

人工智能 2026-02-03 v1 机器学习

摘要

我们提出了一种用于分析大型语言模型(LLM)中多头注意力的几何框架。该方法不改变注意力机制本身,而是通过顶级-N选择视角直接在值状态空间中研究其行为。我们定义了几何指标——精确率、召回率和F分数——用于量化所选与未选标记之间的可分性,并在以实验数据启发的假设下(稳定的值范数、压缩的投射标记、指数相似衰减以及分段注意力权重轮廓)推导出明确依赖于维度和间隔的非渐近界限。理论预测出在小-N运行 regime中实现最强的非平凡可分性,并阐明了序列长度和投射相似度如何影响这些指标。实验上,跨LLaMA-2-7B、Gemma-7B和Mistral-7B,测量结果与理论边界 closely match:顶级-N选择使可分性更锐利,投射相似度与召回率相关。我们还发现LLaMA-2-7B的注意力头可specialize为三种regime——检索者、混合者、复位者——具有不同的几何特征。总体而言,注意力表现为一个具有可测量标准的结构化几何分类器,为注意力头层级可解释性以及几何感知稀疏化和LLM注意力设计提供了指导。

关键词

引用

@article{arxiv.2602.01893,
  title  = {Geometric Analysis of Token Selection in Multi-Head Attention},
  author = {Timur Mudarisov and Mikhal Burtsev and Tatiana Petrova and Radu State},
  journal= {arXiv preprint arXiv:2602.01893},
  year   = {2026}
}