基于因果依存的 LLM 机理可解释性:可信自然语言解释
计算与语言
2026-03-12 v1 人工智能
摘要
机理可解释性识别负责模型行为的内部电路,但将这些发现转化为人类可理解的解释仍是一个开放问题。我们提出了一条管道,将电路水平分析与自然语言解释相结合:(i) 通过激活修补识别因果重要注意力头;(ii) 使用基于模板和 LLM 基于方法生成解释;(iii) 使用针对电路级归因的 ERASER 风格指标进行可信度评估。我们在 GPT-2 Small(1.24 亿参数)上的间接宾主识别(Indirect Object Identification, IOI)任务上进行评估,识别出六个注意力头负责 61.4% 的logit 差异。我们的电路基于解释在充分性上达到 100%,但在完整性方面仅为 22%,揭示了分布式备份机制。LLM 生成的解释在质量指标上显著优于模板基线方法,提升了 64%。我们发现模型置信度与解释可信度之间不存在相关性(r = 0.009),并确定了三类解释何时与机制不一致的 failure 类别。
引用
@article{arxiv.2603.09988,
title = {Causally Grounded Mechanistic Interpretability for LLMs with Faithful Natural-Language Explanations},
author = {Ajay Pravin Mahale},
journal= {arXiv preprint arXiv:2603.09988},
year = {2026}
}
备注
8 pages, 7 figures, 4 tables. MSc thesis work conducted at Hochschule Trier (2026). Code will be released upon publication