利用对抗训练给出神经网络的简洁解释
机器学习
2020-07-07 v9 机器学习
摘要
我们展示了深度神经网络(DNNs)的对抗学习与可解释性之间的新联系。以输入特征表述神经网络模型输出的一种解释形式,是一个特征归因向量。基于归因的解释的两个理想特性是:(1) :不相关或弱相关特征的归因应可忽略,从而就显著特征给出 解释;以及 (2) :在输入的微小局部邻域内不应有显著变化。我们的第一个贡献是理论探讨这两个性质(当使用基于积分梯度(IG)的归因时)如何与对抗训练相关联,针对一类单层网络(包括二分类与多分类的逻辑回归模型);对这些网络我们证明 (a) 使用 有界对抗者的对抗训练产生具有稀疏归因向量的模型,以及 (b) 在自然模型训练中鼓励稳定解释(通过损失函数中的额外项)等价于对抗训练。我们的第二个贡献是对现象 (a) 的实证验证,我们有些意外地发现,该现象 , ,并超越基于 IG 的归因,扩展到基于 DeepSHAP 的归因:与自然训练相比,带 有界扰动的对抗训练产生显著更稀疏的归因向量,且在自然测试数据上性能下降很小。此外,归因向量的稀疏性显著优于通过 正则化自然训练所能达到的。
引用
@article{arxiv.1810.06583,
title = {Concise Explanations of Neural Networks using Adversarial Training},
author = {Prasad Chalasani and Jiefeng Chen and Amrita Roy Chowdhury and Somesh Jha and Xi Wu},
journal= {arXiv preprint arXiv:1810.06583},
year = {2020}
}
备注
30 pages, 9 figures, 1 table