中文

基于对抗批评家的改进网络鲁棒性

机器学习 2018-10-31 v1 计算机视觉与模式识别 机器学习

摘要

理想情况下,令神经网络困惑的也应令人类困惑。然而,近期实验表明,微小且不可感知的扰动即可改变网络预测。为弥补这一感知差距,我们提出一种学习鲁棒分类器的新方法。我们的核心思想是:鲁棒分类器的对抗样本应与对抗目标的常规数据不可区分。我们在生成对抗网络(GAN)框架下表述鲁棒分类器的学习问题,其中对分类器的对抗攻击充当生成器,而批评家网络学习区分常规图像与对抗图像。分类器代价增补了如下目标:其对抗样本应混淆对抗批评家。为提升对抗映射的稳定性,我们引入对抗循环一致性约束,确保对抗样本的对抗映射接近于原样本。实验中,我们展示了我们防御的有效性。我们的方法在鲁棒性方面超越了以对抗训练训练的网络。此外,我们在 MTurk 上通过人类标注者的实验验证对抗样本确实在视觉上令人困惑。项目代码见 https://github.com/aam-at/adversary_critic。

关键词

引用

@article{arxiv.1810.12576,
  title  = {Improved Network Robustness with Adversary Critic},
  author = {Alexander Matyasko and Lap-Pui Chau},
  journal= {arXiv preprint arXiv:1810.12576},
  year   = {2018}
}