标签数据与符号方法在隐藏神经激活分析中的价值
人工智能
2026-02-23 v1
摘要
解释性人工智能的一个主要挑战在于正确解释隐藏神经元的激活:准确的解释将有助于回答深层学习系统内部检测输入相关性的问题,解构深层学习系统的黑盒本质。最新技术表明,隐藏节点激活在某些情况下可被解释为符合人类认知的方式,但系统化的自动方法尚未充分探索,以假设和验证隐藏神经元激活的解释。这在能够从大量背景知识中生成解释、且基于本质上可解释(符号)方法的研究方法方面尤为缺乏。本文引入了一种 novel model-agnostic post-hoc 解释性AI方法,表明其提供有意义的解释。我们的方法基于来自维基百科的概念层次结构(约200万个类别)作为背景知识,并利用基于OWL推理的概念诱导生成解释。此外,我们探索并比较了即插即用预训练多模态的可解释方法的能力。我们的结果表明,该方法可以自动为卷积神经网络密集层中 individual 神经元附加有意义的类表达式解释。通过统计分析和隐藏层中概念激活程度的评估,我们的方法在定量和定性方面相对于先前工作具有竞争优势。
引用
@article{arxiv.2404.13567,
title = {On the Value of Labeled Data and Symbolic Methods for Hidden Neuron Activation Analysis},
author = {Abhilekha Dalal and Rushrukh Rayan and Adrita Barua and Eugene Y. Vasserman and Md Kamruzzaman Sarker and Pascal Hitzler},
journal= {arXiv preprint arXiv:2404.13567},
year = {2026}
}