对抗性 Logit 配对
机器学习
2018-03-20 v1 机器学习
摘要
在本文中,我们开发了大规模防御对抗样本的改进技术。首先,我们在 ImageNet 上以前所未有的规模实现了 SOTA 的对抗训练版本,并研究了其在该设置下是否仍然有效——这是一个重要的开放科学问题(Athalye et al., 2018)。接下来,我们利用一种称为 logit 配对的技术引入了增强防御,该方法鼓励样本对的 logit 相似。当应用于干净样本及其对抗对应样本时,logit 配对在对抗样本上的准确率优于原始对抗训练;我们还发现,仅在干净样本上进行 logit 配对,其在两个数据集上的准确率可与对抗训练相媲美。最后,我们展示了对抗性 logit 配对在 ImageNet 上针对 PGD 白盒攻击实现了 SOTA 防御,准确率从 1.5% 提升至 27.9%。对抗性 logit 配对还成功破坏了当前 ImageNet 上针对黑盒攻击的 SOTA 防御(Tramer et al., 2018),将其准确率从 66.6% 降至 47.1%。凭借这一新的准确率下降,对抗性 logit 配对在 ImageNet 黑盒攻击上与 Tramer et al. (2018) 并列 SOTA。
引用
@article{arxiv.1803.06373,
title = {Adversarial Logit Pairing},
author = {Harini Kannan and Alexey Kurakin and Ian Goodfellow},
journal= {arXiv preprint arXiv:1803.06373},
year = {2018}
}
备注
10 pages