Transformers Linearly Represent Highly Structured World Models
机器学习
2026-05-20 v1 人工智能
摘要
变换器在训练序列推理痕迹时,是否构建了底层任务的内部模型?且该模型的内部表示结构是否反映了领域的结构?我们在数独求解痕迹上训练了一个 8 层变换器,对其内部计算进行机制分析。我们确立了两个结果:第一,模型构建子结构世界模型:它不以人类分析师期望的单元格为单位表示棋盘状态,而是围绕数独约束作用的行、列和箱组织信息。第二,我们识别出一种裸单格电路:一种位于最终 MLP 层的少量专用神经元,每个神经元可可靠地检测特定单元格仅剩一个可能数字,并可靠地促进该数字。这些发现表明,新发世界模型的几何由领域约束代数决定,而非其表面呈现方式;且产生的决策电路稀疏、单语义且完全可解释。更广泛地,他们展示了机制可解释性工具可恢复变换器解决组合推理任务的端到端算法账户。
引用
@article{arxiv.2605.18847,
title = {Transformers Linearly Represent Highly Structured World Models},
author = {Roman Kniazev and Nathanaël Fijalkow},
journal= {arXiv preprint arXiv:2605.18847},
year = {2026}
}