中文

小型 Transformer 模型的分解

机器学习 2025-12-10 v2

摘要

最近的工作表明,对模型在参数空间进行分解可能为分析和干预提供干净的句柄。以前的方法已在广泛的玩具模型上 demonstrating successful applications,但从"真实模型"到实际模型的鸿沟尚未跨越。在本文中,我们将随机参数分解 (SPD) 扩展到 Transformer 模型,提出了一个适用于序列数据的新的因果重要性函数和新的损失函数。我们展示了 SPD 能够成功分解一个玩具归纳头模型并恢复预期的 2 步电路。我们还表明,将 SPD 应用于 GPT-2-small 能够成功定位与可解释概念(如"golf"和"basketball")相对应的子组件。这些结果为将 SPD 扩展到现代模型的方向上的首次尝试,表明我们可以利用该方法暴露可解释的参数空间机制。

关键词

引用

@article{arxiv.2511.08854,
  title  = {Decomposition of Small Transformer Models},
  author = {Casper L. Christensen and Logan Riggs},
  journal= {arXiv preprint arXiv:2511.08854},
  year   = {2025}
}

备注

Accepted at Neurips 2025 Workshop on Mechanistic Interpretability