中文

解释对抗训练的卷积神经网络

机器学习 2019-05-24 v1 计算机视觉与模式识别 机器学习

摘要

我们尝试解释对抗训练的卷积神经网络(AT-CNNs)如何识别物体。我们设计了系统的方法来以定性和定量两种方式解释AT-CNNs,并将其与正常训练的模型进行比较。令人惊讶的是,我们发现当在物体识别任务上训练时,对抗训练缓解了标准CNN的纹理偏置,并帮助CNN学习更具形状偏置的表示。我们从两方面验证了该假设。首先,我们在干净图像和不同变换下的图像上比较AT-CNNs与标准CNN的显著图。该比较可直观显示两类CNN的预测对截然不同类型的特征敏感。其次,为实现定量验证,我们构建了额外的测试数据集,破坏纹理或形状其中之一,例如干净数据的风格迁移版本、饱和图像和块打乱图像,然后在这些数据集上评估AT-CNNs与正常CNN的分类准确率。我们的发现为为何AT-CNNs比正常训练的模型更鲁棒提供了一些启示,并有助于从解释视角更好地理解CNN上的对抗训练。

关键词

引用

@article{arxiv.1905.09797,
  title  = {Interpreting Adversarially Trained Convolutional Neural Networks},
  author = {Tianyuan Zhang and Zhanxing Zhu},
  journal= {arXiv preprint arXiv:1905.09797},
  year   = {2019}
}

备注

To apper in ICML19