SpArX:用于神经网络的稀疏论证式解释[技术报告]
人工智能
2023-08-01 v3 机器学习
机器学习
摘要
神经网络(NNs)在人工智能中有多种应用,但解释其决策仍具挑战性。现有方法常侧重于解释改变单个输入如何影响神经网络的输出。然而,与神经网络输入输出行为一致的解释未必能忠实反映其实际机制。本文中,我们利用多层感知机(MLPs)与定量论证框架(QAFs)之间的关系,为MLPs的机制创建论证式解释。我们的SpArX方法首先在尽可能保持原有结构的同时对MLP进行稀疏化,然后将稀疏MLP转化为等价的QAF,以揭示MLP的底层决策过程,生成全局和/或局部解释。我们通过实验证明,SpArX能比现有方法给出更忠实的解释,同时更深入地洞察MLP的实际推理过程。
引用
@article{arxiv.2301.09559,
title = {SpArX: Sparse Argumentative Explanations for Neural Networks [Technical Report]},
author = {Hamed Ayoobi and Nico Potyka and Francesca Toni},
journal= {arXiv preprint arXiv:2301.09559},
year = {2023}
}
备注
Accepted at ECAI 2023 - 26th European Conference on Artificial Intelligence