中文

神经网络预测的分层解释

机器学习 2019-01-17 v2 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

深度神经网络(DNNs)因能学习变量间复杂的非线性关系而取得了令人印象深刻的预测性能。然而,无法有效可视化这些关系导致DNNs被刻画为黑箱,并进而限制了其应用。为改善此问题,我们引入分层解释的使用,通过所提方法——凝聚式上下文分解(ACD)来解释DNN预测。给定训练后DNN的一个预测,ACD产生输入特征的一个层次聚类,以及每个簇对最终预测的贡献。该层次被优化以识别DNN所学具预测性的特征簇。利用Stanford Sentiment Treebank与ImageNet上的例子,我们展示ACD能有效诊断错误预测并识别数据集偏差。通过人类实验,我们证明ACD使用户既能识别两个DNN中较准确者,也能更好地信任DNN的输出。我们还发现ACD的层次对对抗扰动大体鲁棒,意味着其捕获了输入的基本方面并忽略了伪噪声。

关键词

引用

@article{arxiv.1806.05337,
  title  = {Hierarchical interpretations for neural network predictions},
  author = {Chandan Singh and W. James Murdoch and Bin Yu},
  journal= {arXiv preprint arXiv:1806.05337},
  year   = {2019}
}

备注

Published in ICLR 2019