中文

利用符号梯度对神经网络分类器进行闭式解释

机器学习 2024-10-02 v2 人工智能

摘要

我引入了一个统一框架,用于寻找人工神经网络中任意单个神经元的闭式解释。利用该框架,我演示了如何解释神经网络分类器,以揭示其决策边界中编码概念的闭式表达式。与基于神经网络的回归不同,对于分类而言,即使神经网络本身基于一个可写为闭式方程的量进行分类,通常也不可能将该神经网络表示为符号方程的形式。该解释框架基于将训练好的神经网络嵌入到编码相同概念的函数等价类中。我通过寻找该等价类与由符号搜索空间定义的人类可读方程之间的交集来解释这些神经网络。该方法不限于分类器或完整神经网络,可应用于隐藏层或潜在空间中的任意神经元。

关键词

引用

@article{arxiv.2401.04978,
  title  = {Closed-Form Interpretation of Neural Network Classifiers with Symbolic Gradients},
  author = {Sebastian Johann Wetzel},
  journal= {arXiv preprint arXiv:2401.04978},
  year   = {2024}
}