中文

拆解黑箱:神经网络算法理解的机制性可解释性

机器学习 2025-11-25 v1

摘要

深度神经网络的黑箱性质对部署透明且可信赖的人工智能(AI)系统构成了重大挑战。随着AI在社会中的日益普及,开发能够解释和解读这些系统决策的方法变得越来越重要。为此,机制性可解释性(MI)作为可解释人工智能(XAI)更广泛领域内一个有前景且独特的研究方向应运而生。MI是研究神经网络内部计算并将其转化为人类可理解算法的过程。它涵盖了旨在揭示神经网络所实现的计算算法的逆向工程技术。在本文中,我们提出了MI方法的统一分类法,并通过具体示例和伪代码对关键技术进行了详细分析。我们将MI置于更广泛的可解释性格局中加以语境化,比较了其目标、方法和见解与其他XAI分支。此外,我们追溯了MI作为研究领域的发展历程,突出了其概念根源和近期工作的加速步伐。我们论证了MI在支持对机器学习系统更科学理解方面具有巨大潜力——将模型不仅视为解决任务的工具,也视为被研究和理解的系统。我们希望邀请新的研究者加入机制性可解释性领域。

关键词

引用

@article{arxiv.2511.19265,
  title  = {Unboxing the Black Box: Mechanistic Interpretability for Algorithmic Understanding of Neural Networks},
  author = {Bianka Kowalska and Halina Kwaśnicka},
  journal= {arXiv preprint arXiv:2511.19265},
  year   = {2025}
}