对抗式 TCAV——神经网络中间层解释的鲁棒与有效方法
机器学习
2020-02-27 v2 计算机视觉与模式识别
机器学习
摘要
由于内部状态不透明且存在共享的非线性交互,解释神经网络决策及中间层所学信息仍具挑战。尽管 (Kim et al, 2017) 提出通过量化中间层区分用户定义概念(与随机样本相对)的能力来解释中间层,但鲁棒性(针对随机样本选取的变动)与有效性(概念图像的检索率)问题依然存在。我们研究了这两个性质并提出改进,以使概念激活在实际使用中可靠。有效性:若中间层有效学习了用户定义概念,它应能在测试阶段召回大多数含该概念的图像。例如,我们观察到在 ImageNet 数据集上以“鳍”为用户定义概念时,VGG16 对虎鲨与大白鲨的召回率仅 18.35%。为提升概念学习的有效性,我们提出 A-CAV——对抗式概念激活向量——这使使用者概念与(负)随机样本间具有更大间隔,该方法将前述 VGG16 召回率提升至 76.83%。对于鲁棒性,我们将其定义为中间层对不同随机种子在召回率(即有效性)上保持一致的能力。我们观察到 TCAV 在不同随机种子下召回概念时方差很大:例如,学习“尾巴”概念的层对猫图像的召回率在 VGG16 上从 18% 到 86% 变化,标准差达 20.85%。我们提出一种简单且可扩展的改进,利用 Gram-Schmidt 过程从概念中采样随机噪声并学习一个平均“概念分类器”,该方法将前述标准差由 20.85% 降至 6.4%。
引用
@article{arxiv.2002.03549,
title = {Adversarial TCAV -- Robust and Effective Interpretation of Intermediate Layers in Neural Networks},
author = {Rahul Soni and Naresh Shah and Chua Tat Seng and Jimmy D. Moore},
journal= {arXiv preprint arXiv:2002.03549},
year = {2020}
}