中文

基于互信息探究卷积神经网络的对抗样本与对抗鲁棒性

机器学习 2022-07-27 v2 人工智能

摘要

卷积神经网络(CNNs)的一个反直觉特性是其固有的对抗样本易感性,这严重阻碍了CNNs在安全关键领域的应用。对抗样本与原始样本相似但包含恶意扰动。对抗训练是一种简单有效的防御方法,可提高CNNs对对抗样本的鲁棒性。对抗样本与对抗训练背后的机制值得探究。因此,本工作从互信息视角研究了正常训练的CNNs(NT-CNNs)与对抗训练的CNNs(AT-CNNs)在信息提取上的异同。我们表明:1)无论是NT-CNNs还是AT-CNNs,对于原始与对抗样本,互信息随训练的趋势几乎相似;2)与正常训练相比,对抗训练更困难,且AT-CNNs从输入中提取的信息量更少;3)不同方法训练的CNNs对特定类型信息有不同偏好;NT-CNNs倾向于从输入中提取基于纹理的信息,而AT-CNNs偏好基于形状的信息。对抗样本误导CNNs的原因可能是其包含更多其他类别的基于纹理的信息。此外,我们还分析了本工作中使用的互信息估计器,发现它们刻画了中间层输出的几何性质。

关键词

引用

@article{arxiv.2207.05756,
  title  = {Exploring Adversarial Examples and Adversarial Robustness of Convolutional Neural Networks by Mutual Information},
  author = {Jiebao Zhang and Wenhua Qian and Rencan Nie and Jinde Cao and Dan Xu},
  journal= {arXiv preprint arXiv:2207.05756},
  year   = {2022}
}

备注

initial submit 3