中文

概念与标记子子空间中的向量算术

计算与语言 2025-11-25 v1

摘要

为了预测下一个标记,大语言模型必须表示当前单词的语义和表面级信息。前期工作识别了两种注意力头,这些头解耦了这些信息:(i)概念诱导头复制单词含义,(ii)标记诱导头复制字面标记表示(Feucht等,2025)。我们展示,这些头可用于识别模型激活子空间,这些子空间在Llama-2-7b中表现出连贯的语义结构。具体而言,当我们使用概念头的注意力权重对隐藏状态进行转换时,我们能够更准确地对结果隐藏状态执行平行四边形算术(Mikolov等,2013),例如显示“雅典” - “希腊” + “中国” = “北京”。这种转换允许更高的最近邻准确率(80%),而不是直接使用原始隐藏状态(47%)。类似地,我们展示,标记头允许揭示隐藏状态中表面级单词信息的转换,允许诸如“编码” - “code” + “dance” = “dancing”之类的操作。

关键词

引用

@article{arxiv.2511.18162,
  title  = {Vector Arithmetic in Concept and Token Subspaces},
  author = {Sheridan Feucht and Byron Wallace and David Bau},
  journal= {arXiv preprint arXiv:2511.18162},
  year   = {2025}
}

备注

9 pages, 6 figures. NeurIPS 2025 Mechanistic Interpretability Workshop