中文

使用单步对抗训练防御迭代对抗样本

机器学习 2020-02-28 v2 密码学与安全 机器学习

摘要

对抗样本已成为机器学习模型(尤其是神经网络分类器)面临的最大挑战之一。这些对抗样本打破了无攻击场景的假设,并以对人而言微不足道的扰动欺骗最先进的(SOTA)分类器。迄今为止,研究者在利用对抗训练作为防御手段上取得重大进展。然而,过高的计算成本削弱了其适用性,且鲜有工作克服该问题。单步对抗训练方法已被提出作为计算上可行的方案,但它们仍无法防御迭代对抗样本。在本工作中,我们首先通过实验分析几种不同的 SOTA 对抗样本防御方法。随后,基于实验观察,我们提出一种新颖的单步对抗训练方法,可同时防御单步与迭代对抗样本。最后,通过广泛评估,我们证明所提方法优于 SOTA 单步与迭代对抗训练防御。在 CIFAR10 数据集上相较于 ATDA(单步方法),所提方法的测试准确率提升 35.67%,训练时间减少 19.14%。当在 CIFAR10 数据集上与使用 BIM 或 Madry 样本(迭代方法)的方法比较时,其训练时间最多节省 76.03%,测试准确率退化小于 3.78%。

关键词

引用

@article{arxiv.2002.09632,
  title  = {Using Single-Step Adversarial Training to Defend Iterative Adversarial Examples},
  author = {Guanxiong Liu and Issa Khalil and Abdallah Khreishah},
  journal= {arXiv preprint arXiv:2002.09632},
  year   = {2020}
}