受约束的信念更新解释 Transformer 表示中的几何结构
机器学习
2025-10-16 v2
摘要
在下一 token 预测任务上训练的 Transformer 中会涌现出何种计算结构?在这项工作中,我们提供证据表明 Transformer 实现了受约束的贝叶斯信念更新——一种由架构约束塑造的部分贝叶斯推理的并行化版本。我们将模型无关的最优预测理论与机制可解释性相结合,以分析在可处理的隐马尔可夫模型族上训练的 Transformer,这些模型在神经激活中产生丰富的几何模式。我们的主要分析集中在单层 Transformer 上,揭示了第一注意力层如何实现这些受约束的更新,并扩展到多层架构,展示了后续层如何细化这些表示。我们发现注意力执行了一种在概率单纯形中具有自然解释的算法,并创建了具有独特几何结构的表示。我们展示了如何通过修改最优未来 token 预测的方程以考虑注意力的架构约束,从理论上详细预测这些表示的算法行为和底层几何结构——包括注意力模式、OV 向量和嵌入向量。我们的方法提供了一个原则性的视角,用以理解架构约束如何塑造最优预测的实现,揭示了 Transformer 为何会发展出特定的中间几何结构。
引用
@article{arxiv.2502.01954,
title = {Constrained belief updates explain geometric structures in transformer representations},
author = {Mateusz Piotrowski and Paul M. Riechers and Daniel Filan and Adam S. Shai},
journal= {arXiv preprint arXiv:2502.01954},
year = {2025}
}