中文

神经网络解码:通过因果解释与推理进行针对性和稳健的神经网络决策分析

机器学习 2024-10-10 v1 人工智能 统计方法学

摘要

尽管深度神经网络(DNN)取得了成功并被广泛采用,但其不透明的本质仍然阻碍了信任,尤其是在关键应用中。当前的可解释性解决方案往往产生不一致或过于简化的解释,或需要修改模型而妥协性能。本文引入了 TRACER 方法,这是一种基于因果推断理论的新方法,用于估计DNN决策背后的因果动态,而无需改变其体系结构或妥协性能。我们的方法系统性地对输入特征进行干预,以观察特定更改如何通过网络传播,影响内部激活和最终输出。基于此分析,我们确定 individual features 的重要性,并通过将功能相似的层分组为 cohesive causal 节点来构建高层次因果图,提供了网络不同部分如何影响决策的结构化和可解释视图。TRACER 进一步通过生成反事实案例来增强可解释性,这些案例揭示了可能的模型偏见,并为误分类提供对比解释。通过多样化数据集的全面评估,我们展示了 TRACER 的有效性优于现有方法,并显示其在创建高度压缩且准确模型方面的潜力,说明其在理解和优化 DNN 方面的双重多功能性。

关键词

引用

@article{arxiv.2410.05484,
  title  = {Neural Networks Decoded: Targeted and Robust Analysis of Neural Network Decisions via Causal Explanations and Reasoning},
  author = {Alec F. Diallo and Vaishak Belle and Paul Patras},
  journal= {arXiv preprint arXiv:2410.05484},
  year   = {2024}
}