中文

测试GPT-2 Transformer的自注意力机制的自旋浴观点:哈密顿量分析

材料科学 2026-01-01 v7 机器学习

摘要

Huo和Johnson于2024年提出的物理学方法将大型语言模型(LLM)的注意力机制建模为相互作用的两体自旋系统,提供了对现象如重复和偏差的从头开始的解释。建立在此假设基础上,我们从生产级GPT-2模型中提取完整的Query-Key权重矩阵,并为每个注意力头推导相应的有效哈密顿量。从这些哈密顿量出发,我们获得解析相位边界和logit间隙准则,预测给定上下文中应由哪个token支配下一个token分布。在144个注意力头跨20个事实记忆提示上进行系统评估,显示理论logit间隙与模型经验token排名之间存在强烈负相关(r0.70r\approx-0.70p<103p<10^{-3})。针对性消除实验进一步表明,抑制最符合自旋浴预测的注意力头会引发输出概率的预期偏移,确认了因果联系而非偶然关联。综上所述,我们的发现为生产级模型中的自旋浴类比提供了首个强有力的实证证据。本文采用context-field透镜,提供基于物理的可解释性,激发开发新型生成模型,桥接理论凝聚态物理与人工智能。

关键词

引用

@article{arxiv.2507.00683,
  title  = {Testing the spin-bath view of self-attention: A Hamiltonian analysis of GPT-2 Transformer},
  author = {Satadeep Bhattacharjee and Seung-Cheol Lee},
  journal= {arXiv preprint arXiv:2507.00683},
  year   = {2026}
}