中文

利用对抗训练给出神经网络的简洁解释

机器学习 2020-07-07 v9 机器学习

摘要

我们展示了深度神经网络(DNNs)的对抗学习与可解释性之间的新联系。以输入特征表述神经网络模型输出的一种解释形式,是一个特征归因向量。基于归因的解释的两个理想特性是:(1) 稀疏性\textit{稀疏性}:不相关或弱相关特征的归因应可忽略,从而就显著特征给出 简洁\textit{简洁} 解释;以及 (2) 稳定性\textit{稳定性}:在输入的微小局部邻域内不应有显著变化。我们的第一个贡献是理论探讨这两个性质(当使用基于积分梯度(IG)的归因时)如何与对抗训练相关联,针对一类单层网络(包括二分类与多分类的逻辑回归模型);对这些网络我们证明 (a) 使用 \ell_\infty 有界对抗者的对抗训练产生具有稀疏归因向量的模型,以及 (b) 在自然模型训练中鼓励稳定解释(通过损失函数中的额外项)等价于对抗训练。我们的第二个贡献是对现象 (a) 的实证验证,我们有些意外地发现,该现象 不仅\textit{不仅} 出现在单层网络中\textit{出现在单层网络中}也出现在\textit{也出现在} 标准图像数据集上训练的 DNNs \textit{标准图像数据集上训练的 DNNs 中},并超越基于 IG 的归因,扩展到基于 DeepSHAP 的归因:与自然训练相比,带 \ell_\infty 有界扰动的对抗训练产生显著更稀疏的归因向量,且在自然测试数据上性能下降很小。此外,归因向量的稀疏性显著优于通过 1\ell_1 正则化自然训练所能达到的。

关键词

引用

@article{arxiv.1810.06583,
  title  = {Concise Explanations of Neural Networks using Adversarial Training},
  author = {Prasad Chalasani and Jiefeng Chen and Amrita Roy Chowdhury and Somesh Jha and Xi Wu},
  journal= {arXiv preprint arXiv:1810.06583},
  year   = {2020}
}

备注

30 pages, 9 figures, 1 table