基于自编码激活的深层神经网络因果学习与解释
人工智能
2018-02-05 v1 机器学习
机器学习
摘要
深层神经网络复杂且不透明。随着它们进入各种重要且安全关键的领域应用,用户寻求解释其输出预测的方法。我们提出了一种通过构建 CNN 中显著概念的因果模型来解释深层神经网络的方法。我们开发了利用自编码器提取网络激活的人类可理解表示的方法,以在目标网络中抽取显著概念。然后,我们使用这些提取的概念作为变量构建贝叶斯因果模型,以解释图像分类。最后,我们利用该因果模型识别并可视化对最终分类具有显著因果影响的特征。
引用
@article{arxiv.1802.00541,
title = {Causal Learning and Explanation of Deep Neural Networks via Autoencoded Activations},
author = {Michael Harradon and Jeff Druce and Brian Ruttenberg},
journal= {arXiv preprint arXiv:1802.00541},
year = {2018}
}