A3T:对抗性增强的对抗训练
机器学习
2018-01-15 v1 机器学习
摘要
近期研究表明,深度神经网络对所谓对抗扰动高度敏感,后者是为欺骗机器学习分类器而精心设计的微小输入数据扰动。大多数分类模型,包括深度学习模型,都极易受到对抗攻击。本工作中,我们研究了一种通过强制表征不变性来提升深度神经网络对抗鲁棒性的方法。其思路是将分类器与一个连接至其某一隐藏层并经过训练以滤除对抗噪声的判别器联合训练。我们进行了初步实验以检验该方法的可行性,并将其与其他标准对抗训练方法进行比较。
引用
@article{arxiv.1801.04055,
title = {A3T: Adversarially Augmented Adversarial Training},
author = {Akram Erraqabi and Aristide Baratin and Yoshua Bengio and Simon Lacoste-Julien},
journal= {arXiv preprint arXiv:1801.04055},
year = {2018}
}
备注
accepted for an oral presentation in Machine Deception Workshop, NIPS 2017