可信且稳定的神经元解释:面向可靠机理可解释性的理论分析
人工智能
2025-12-23 v1 机器学习
摘要
神经元识别是机理可解释性中流行的工具,旨在揭示深度网络中单个神经元所代表的人类可解释概念。虽然 Network Dissection 和 CLIP-Dissect 等算法取得了很大的经验成功,但缺乏严格的理论基础,这对于实现可信赖且可靠的解释至关重要。本文中,我们观察到神经元识别可被视为机器学习的逆过程,这使我们能够为神经元解释推导出保证。基于此洞见,我们提出了对两个基本挑战的首个理论分析:(1)忠诚性:识别的概念是否忠实地代表了神经元的底层功能;(2)稳定性:识别结果是否在不同探测数据集上保持一致。我们推导出广泛使用的相似度度量(如准确率、AUROC、IoU)的泛化界限,以保证忠诚性,并提出了一种自助抽样集方法,用于量化稳定性,并提出 BE(Bootstrap Explanation)方法生成具有保证覆盖概率的概念预测集合。实验在合成数据和真实数据上均验证了我们的理论结果,展示了我们方法的实用性,为可信的神经元识别迈出了重要一步。
引用
@article{arxiv.2512.18092,
title = {Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability},
author = {Ge Yan and Tuomas Oikarinen and Tsui-Wei and Weng},
journal= {arXiv preprint arXiv:2512.18092},
year = {2025}
}