基于特征散射对抗训练的抗对抗攻击防御
计算机视觉与模式识别
2019-11-25 v4 密码学与安全
机器学习
摘要
我们引入一种基于特征散射的对抗训练方法,以提升模型抵御对抗攻击的鲁棒性。传统对抗训练方法在生成训练用攻击时利用监督式方案(目标或非目标),如近期工作所指出的,通常存在标签泄漏等问题。不同的是,所提方法通过在隐空间中进行特征散射生成对抗图像用于训练,其本质是无监督的并避免了标签泄漏。更重要的是,这一新方法以协作方式生成扰动图像,考虑了样本间关系。我们对模型鲁棒性进行分析,并通过在不同数据集上与 state-of-the-art 方法对比的广泛实验证明了所提方法的有效性。
引用
@article{arxiv.1907.10764,
title = {Defense Against Adversarial Attacks Using Feature Scattering-based Adversarial Training},
author = {Haichao Zhang and Jianyu Wang},
journal= {arXiv preprint arXiv:1907.10764},
year = {2019}
}
备注
Published at NeurIPS 2019