概念与标记子子空间中的向量算术
计算与语言
2025-11-25 v1
摘要
为了预测下一个标记,大语言模型必须表示当前单词的语义和表面级信息。前期工作识别了两种注意力头,这些头解耦了这些信息:(i)概念诱导头复制单词含义,(ii)标记诱导头复制字面标记表示(Feucht等,2025)。我们展示,这些头可用于识别模型激活子空间,这些子空间在Llama-2-7b中表现出连贯的语义结构。具体而言,当我们使用概念头的注意力权重对隐藏状态进行转换时,我们能够更准确地对结果隐藏状态执行平行四边形算术(Mikolov等,2013),例如显示“雅典” - “希腊” + “中国” = “北京”。这种转换允许更高的最近邻准确率(80%),而不是直接使用原始隐藏状态(47%)。类似地,我们展示,标记头允许揭示隐藏状态中表面级单词信息的转换,允许诸如“编码” - “code” + “dance” = “dancing”之类的操作。
引用
@article{arxiv.2511.18162,
title = {Vector Arithmetic in Concept and Token Subspaces},
author = {Sheridan Feucht and Byron Wallace and David Bau},
journal= {arXiv preprint arXiv:2511.18162},
year = {2025}
}
备注
9 pages, 6 figures. NeurIPS 2025 Mechanistic Interpretability Workshop