利用对抗训练自编码器实现模型无关的对抗防御
计算机视觉与模式识别
2020-03-31 v3 机器学习
摘要
对抗机器学习是一个研究充分的领域,其中 adversary 通过对输入的精确操纵使机器学习算法产生可预测的错误。已提出大量技术来强化机器学习算法并减轻对抗攻击的影响。在这些技术中,对抗训练(用对抗样本扩充训练数据)已被证明是针对某类攻击的有效防御。然而,对抗训练计算代价高,且其改进局限于单一模型。本工作中,我们向创建模型无关对抗防御迈出第一步。我们提出Adversarially-Trained Autoencoder Augmentation(AAA),这是首个针对特定自适应 adversary 鲁棒的模型无关对抗防御。我们展示AAA通过训练单个自编码器来保护多个预训练分类器,从而实现部分模型无关的防御;在无需修改分类器的情况下达到与对抗训练相当或更好的对抗性能。此外,我们证明AAA可用于为MNIST和Fashion MNIST数据集创建完全模型无关的防御,将前所未见的预训练分类器的对抗性能提升至少45%且无需额外训练。最后,利用自然图像腐蚀数据集,我们展示我们的方法提升了对自然腐蚀图像的鲁棒性,而这已被认为是对真正对抗鲁棒性的强烈指示。
引用
@article{arxiv.1909.05921,
title = {Towards Model-Agnostic Adversarial Defenses using Adversarially Trained Autoencoders},
author = {Pratik Vaishnavi and Kevin Eykholt and Atul Prakash and Amir Rahmati},
journal= {arXiv preprint arXiv:1909.05921},
year = {2020}
}