中文

Transformer表示的因果维度:度量、缩放与层级结构

机器学习 2026-05-12 v1 人工智能

摘要

稀疏自编码器将Transformer残差流分解为可解释的特征字典,但SAE宽度与对模型输出的因果影响之间的关系尚未被系统地表征。我们引入了因果维度κ(L, M, T),定义为第L层期望雅可比外积的有效秩,并展示了它可以通过SAE宽度扫描结合归因修补来估计。在Gemma-2-2B第12层上,跨越从16,384到1,048,576个特征的七种SAE宽度,表示能力增长了15.6倍,而因果能力仅增长了4.35倍:我们将这种稳健的分离称为表示-因果楔形。一个饱和拟合给出κ̂ ≈ 1,990,κ̂/d_model = 0.86,以及参与率下界κ_PR ≈ 280。关键的是,κ对模型缩放具有不变性:在相同SAE宽度下,Gemma-2-9B和Gemma-2-2B产生相同的N_causal = 328,尽管参数量增加了3.46倍(该计数通过校准被强制为SAE宽度的2%;实质性的经验主张是在匹配的seq=512条件下AtP分数分布的形状不变性)。在八个网络深度上,κ保持恒定,而绝对归因阈值从第1层到第23层下降了20倍。五个控制实验(架构不变性、阈值鲁棒性、几何特权、合成真实恢复以及四单元编码器/解码器消融)确定了κ度量什么以及不度量什么。我们的发现确立了κ作为Transformer层的一个可测量、模型固有的属性:可通过SAE宽度亚线性恢复、对模型缩放不变、并在网络深度上具有结构。

关键词

引用

@article{arxiv.2605.08740,
  title  = {Causal Dimensionality of Transformer Representations: Measurement, Scaling, and Layer Structure},
  author = {Nilesh Sarkar and Dawar Jyoti Deka},
  journal= {arXiv preprint arXiv:2605.08740},
  year   = {2026}
}

备注

9 pages, 17 figures, 14 tables (excluding references and appendices). Companion short paper under review at the ICML 2026 Mechanistic Interpretability Workshop. Code: https://anonymous.4open.science/r/NeurIPS-Causal-Capacity-in-SAEs-7D20/