中文

Transformer中的几何事实记忆

计算与语言 2026-05-13 v1

摘要

Transformer语言模型如何记忆事实关联?一种常见观点将内部权重矩阵视为嵌入对上的关联记忆,其参数数量随事实数量线性增长。我们发展了一种替代性几何记忆形式的理论和实证描述,其中学习到的嵌入直接编码关系结构,而MLP扮演了性质不同的角色。在一个受控设置中,单层Transformer必须记忆从主体到共享属性集的随机双射,我们证明对数维度的嵌入维度就足够了:主体嵌入编码其关联属性向量的线性叠加,而一个小型MLP充当关系条件选择器,通过ReLU门控提取相关属性,而非作为关联键值映射。我们将这些结果扩展到多跳设置——例如“谁是xx的妻子的母亲?”这样的关系查询链——提供了有和没有思维链的构造,展示了可证明的容量-深度权衡,并辅以匹配的信息论下界。实验上,梯度下降发现了精确具有预测结构的解。一旦训练完成,当主体嵌入被适当重新初始化时,MLP可以零样本迁移到全新的双射上,这表明它学习了一种通用的选择机制,而非记忆任何特定的事实集合。

关键词

引用

@article{arxiv.2605.12426,
  title  = {Geometric Factual Recall in Transformers},
  author = {Shauli Ravfogel and Gilad Yehudai and Joan Bruna and Alberto Bietti},
  journal= {arXiv preprint arXiv:2605.12426},
  year   = {2026}
}

备注

Preprint