小型 Transformer 模型的分解
机器学习
2025-12-10 v2
摘要
最近的工作表明,对模型在参数空间进行分解可能为分析和干预提供干净的句柄。以前的方法已在广泛的玩具模型上 demonstrating successful applications,但从"真实模型"到实际模型的鸿沟尚未跨越。在本文中,我们将随机参数分解 (SPD) 扩展到 Transformer 模型,提出了一个适用于序列数据的新的因果重要性函数和新的损失函数。我们展示了 SPD 能够成功分解一个玩具归纳头模型并恢复预期的 2 步电路。我们还表明,将 SPD 应用于 GPT-2-small 能够成功定位与可解释概念(如"golf"和"basketball")相对应的子组件。这些结果为将 SPD 扩展到现代模型的方向上的首次尝试,表明我们可以利用该方法暴露可解释的参数空间机制。
关键词
引用
@article{arxiv.2511.08854,
title = {Decomposition of Small Transformer Models},
author = {Casper L. Christensen and Logan Riggs},
journal= {arXiv preprint arXiv:2511.08854},
year = {2025}
}
备注
Accepted at Neurips 2025 Workshop on Mechanistic Interpretability