从相关性到因果性:变换器语言模型中特征分析的五阶段方法
计算与语言
2026-05-22 v1 人工智能
摘要
我们提出了一种用于变换器语言模型中因果特征分析的五阶段方法(探针设计、特征提取、因果验证、鲁棒性测试和部署集成),并在GPT-2 small执行间接宾语识别(IOI)任务时对其进行端到端演示。激活修补恢复了标准IOI电路(仅层9头9即可实现+1.02的恢复)。稀疏自编码器恢复了每个名称选择性特征,效果大小为30至50个激活单位。因果验证发现这些特征具有特定性,但仅部分具有因果性:剔除其中15个特征后,模型在98%的提示上仍保持准确。两个受NLA启发的评估进一步加强了这一结论:这15个选择性特征仅解释了31%的激活方差,而SAE可解释99.7%,选择性比率与因果力呈负相关(r = -0.56)。在三种分布迁移下的鲁棒性测试发现,电路可以干净地迁移,但特征消除效应显著下降,这暴露了检测鲁棒性与因果鲁棒性之间的差距。一种基于成本的部署评估(假设0.42/假阳性,2%错误率)找到的最优监控配置相对于8.96的成本,节省99.1%。最优的组合策略随着成本比和基准比例的变化而变化。五个阶段的联合作用产生了没有单个阶段能够产生的发现。
引用
@article{arxiv.2605.22462,
title = {From Correlation to Cause: A Five-Stage Methodology for Feature Analysis in Transformer Language Models},
author = {Caleb Munigety},
journal= {arXiv preprint arXiv:2605.22462},
year = {2026}
}