局部化定义与分布式推理:通过激活修补验证概念可解释性研究
机器学习
2025-04-07 v1 人工智能
摘要
本研究通过激活修补法(Activation Patching)进行因果层次归因(Causal Layer Attribution via Activation Patching, CLAP),探讨微调后的 GPT-2 模型中知识表示的局部化。该模型在 9,958 篇 PubMed 摘要上进行微调(epilepsy:20,595 条提及,EEG:11,674 条提及,seizure:13,921 条提及),使用两种配置并监控验证损失进行早期停止。CLAP涉及(1)缓存干净(正确答案)和损坏(错误答案)的激活,(2)计算 logits 差异以量化模型偏好,(3)用干净的激活修补损坏的激活以评估恢复。结果显示:首先,修补第一层前馈层恢复了56%的正确偏好,表明关联知识分布在多个层次。其次,修补最终输出层完全恢复了准确率(100%恢复),表明定义性知识是局部化的。更强的干净 logits 差异进一步支持了这种局部分表示。第三,卷积层修补恢复率仅为13.6%,表明低层特征对高层推理贡献有限。统计分析确认层级效应显著(p<0.01)。这些发现表明,事实知识更为局部化,关联知识依赖于分布式表示。我们还展示了编辑效果取决于任务类型。我们的发现不仅调和了关于模型编辑中局部分表示的矛盾观察,还强调了使用任务自适应技术以实现可靠、可解释的更新。
引用
@article{arxiv.2504.02976,
title = {Localized Definitions and Distributed Reasoning: A Proof-of-Concept Mechanistic Interpretability Study via Activation Patching},
author = {Nooshin Bahador},
journal= {arXiv preprint arXiv:2504.02976},
year = {2025}
}
备注
15 pages, 3 figures