中文

从黑箱到白箱:基于控制论的神经网络可解释性

机器学习 2025-11-18 v1 人工智能 系统与控制 系统与控制

摘要

深度神经网络虽然实现了最先进的性能,但在机制上仍难以解释。本文提出了一种控制论框架,将训练好的神经网络视为非线性状态空间系统,并利用局部线性化、可控性和可观测性格拉曼矩阵,以及Hankel奇异值来分析其内部计算。对于给定输入,我们在相应的隐藏激活模式附近对网络进行线性化,并构建由隐藏神经元激活构成的状态空间模型。输入状态和状态输出Jacobians定义了局部可控性和可观测性格拉曼矩阵,从而计算Hankel奇异值和相关模式。这些量为神经元和通路重要性提供了原则性的概念:可控性衡量每个神经元受输入扰动激活的难易程度,可观测性衡量每个神经元对输出的影响强度,Hankel奇异值对携带输入输出能量的内部模式进行排序。我们在简单的前馈网络上说明了该框架,包括一个1-2-2-1的SwiGLU网络和一个2-3-3-2的GELU网络。通过比较不同的工作点,我们显示激活饱和会降低可控性,缩小主导Hankel奇异值,并将主导内部模式偏移到神经元的不同子集上。该方法将神经网络转化为一组局部白盒动态模型,并建议哪些内部方向是剪枝或约束以提高可解释性的自然候选。

关键词

引用

@article{arxiv.2511.12852,
  title  = {From Black-Box to White-Box: Control-Theoretic Neural Network Interpretability},
  author = {Jihoon Moon},
  journal= {arXiv preprint arXiv:2511.12852},
  year   = {2025}
}