中文

迈向形式化可解释AI:神经网络的 formally 近似极小解释

机器学习 2023-02-10 v2 计算机科学中的逻辑

摘要

随着机器学习的快速发展,深度神经网络(DNNs)现已被用于众多领域。遗憾的是,DNNs是“黑盒”,无法被人类解释,这在安全关键系统中是一个重大隐患。为缓解此问题,研究者已开始研究可解释AI(XAI)方法,其能识别出作为给定输入下DNN决策原因的输入特征子集。大多数现有技术是启发式的,无法保证所提供解释的正确性。相反,近期令人振奋的尝试表明,形式化方法可用于生成可证明正确的解释。尽管这些方法可靠,但底层验证问题的计算复杂性限制了其可扩展性;且它们产生的解释有时可能过于复杂。在此,我们提出一种新方法来应对这些局限。我们(1)提出一种高效的、基于验证的极小解释寻找方法,其构成了全局最小解释的可证明近似;(2)展示DNN验证如何辅助计算最优解释的下界和上界;(3)提出显著提升验证过程可扩展性的启发式方法;(4)建议采用束(bundles),使我们能获得更简洁且可解释的解释。我们的评估表明,该方法显著优于最先进技术,并产生对人类更有用的解释。因此,我们将此工作视为利用验证技术生成更可靠、更易懂的DNNs的一步。

关键词

引用

@article{arxiv.2210.13915,
  title  = {Towards Formal XAI: Formally Approximate Minimal Explanations of Neural Networks},
  author = {Shahaf Bassan and Guy Katz},
  journal= {arXiv preprint arXiv:2210.13915},
  year   = {2023}
}

备注

To appear in Proc. 29th Int. Conf. on Tools and Algorithms for the Construction and Analysis of Systems (TACAS)