中文

多态性即旋转:从两层 Transformer 到 Pythia-70m 的操作性机械可解释性

机器学习 2026-05-26 v1 人工智能 计算与语言

摘要

独立训练的 Transformer 在残差流基中以均匀随机旋转的 SO(dmodel)\mathrm{SO}(d_{\mathrm{model}}) 坐标系计算相同函数。我们称之为多态性:相同函数,内部坐标不可互通。每对模型只需一次矩阵乘法即可消除它:对单个 batch 的激活进行正交 Procrustes 拟合,可将稀疏自编码器特征字典和驾驶向量在无需再训练的情况下在不同模型之间转移。该现象对标准 SAE 通用性指标不可见。解码器列的余弦相似性在种子间保持 98%,而 SAE 通用性 headline 数字如此;但在一个种子上训练的 SAE 对另一个种子的激活重构解释方差为负,甚至差于预测常数均值的效果。解码器列对齐;编码器从旋转坐标系中读取。单个 Procrustes 旋转 RR 在每个内部站点将重建恢复到 0.025 个解释方差以内。RR 为 Haar 分布:RIF||R - I||_F 与随机正交预测 2dmodel\sqrt{2 d_{\mathrm{model}}} 相符,误差仅为 0.1%(当 dmodel=512d_{\mathrm{model}} = 512),且对 RR 的特征谱进行 Kolmogorov-Smirnov 检验与 Haar SO(dmodel)\mathrm{SO}(d_{\mathrm{model}})p1.000p \approx 1.000(合并及成对)。差分均值驾驶向量通过与 RR 的不变子空间对齐在三个 regime 中转移:当由共享输出权重固定时为 clean;当与旋转子空间重叠时为部分;否则为 inverted。若无共享 I/O(Pythia),三者全部退化为普遍反转。同一旋转效应在单个 run 的不同训练检查点间同样成立。在 104k 参数 Dyck-3 Transformer 和九个独立训练的 Pythia-70m 种子(基于 The Pile)上验证,通过预先登记的四栏操作框架。面向前沿规模 (10B+) 的复制仍待开展。

关键词

引用

@article{arxiv.2605.24577,
  title  = {Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m},
  author = {Jordan F. McCann},
  journal= {arXiv preprint arXiv:2605.24577},
  year   = {2026}
}

备注

26 pages, 4 figures, 40 references. Pre-registered four-bar framework; all numerical claims reproducible