中文

目标训练:无需对抗样本即可实现对抗训练

机器学习 2021-02-10 v1

摘要

神经网络分类器易受对抗样本误分类的影响,当前最佳防御方法是通过对抗样本训练分类器。然而,基于对抗攻击核心的最小化原理,对抗样本并非引导攻击收敛的最优选择。通过将训练中的对抗样本替换为仅用于训练的、标签不同的原始样本副本,可将最小化扰动项最小化至00。仅使用原始样本,目标训练消除了针对所有最小化扰动的攻击而生成对抗样本进行训练的需求。在低容量分类器中且不使用对抗样本时,目标训练在CIFAR10上以对抗CW-L2_2(κ=0\kappa=0)攻击的84.884.8%和对抗DeepFool的86.686.6%,超越了默认CIFAR10准确率(84.384.3%)和当前最佳防御准确率(低于2525%)。在使用对抗样本对抗不最小化扰动的攻击时,目标训练在CIFAR10上以对抗CW-L2_2(κ=40\kappa=40)的76.476.4%超越了当前最佳防御(69.169.1%)。

关键词

引用

@article{arxiv.2102.04836,
  title  = {Target Training Does Adversarial Training Without Adversarial Samples},
  author = {Blerta Lindqvist},
  journal= {arXiv preprint arXiv:2102.04836},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2006.04504