中文

用于可解释图像识别的概念白化

机器学习 2020-12-14 v5 人工智能 计算机视觉与模式识别 机器学习

摘要

当我们遍历神经网络的各层时,网络对某一概念编码了什么?机器学习中的可解释性无疑很重要,但神经网络的计算非常难以理解。试图观察其隐藏层的尝试可能会产生误导、无法使用,或依赖于潜在空间具备其可能并不具有的性质。在这项工作中,我们不是尝试对神经网络进行事后分析,而是引入一种称为概念白化(CW)的机制,以改变网络的给定层,从而让我们更好地理解导致该层的计算。当将概念白化模块添加到CNN时,潜在空间的轴与已知感兴趣的概念对齐。通过实验,我们表明CW能为我们提供关于网络如何逐层逐渐学习概念的更清晰理解。CW是批归一化层的一种替代方案,因为它对潜在空间进行归一化,并且去相关(白化)。CW可用于网络的任何层而不损害预测性能。

关键词

引用

@article{arxiv.2002.01650,
  title  = {Concept Whitening for Interpretable Image Recognition},
  author = {Zhi Chen and Yijie Bei and Cynthia Rudin},
  journal= {arXiv preprint arXiv:2002.01650},
  year   = {2020}
}

备注

Authors' pre-publication version of a 2020 Nature Machine Intelligence article