评估几何感知实例重加权对抗训练的鲁棒性
机器学习
2021-03-08 v2 密码学与安全
摘要
在本技术报告中,我们评估了一种非常近期的方法“几何感知实例重加权对抗训练(Geometry-aware Instance-reweighted Adversarial Training,GAIRAT)”[7] 的对抗鲁棒性。GAIRAT 在 CIFAR-10 数据集上针对对抗攻击的防御报告了最先进(SOTA)结果。事实上,我们发现,用该方法训练的网络虽然相较常规对抗训练(AT)有所改进,但通过重新缩放损失将模型偏向了某些样本。确实,这导致模型易受缩放 logits 的攻击。原模型在 AutoAttack 下显示出 59% 的准确率——当使用带伪标签的额外数据训练时。我们提供的分析得出了相反结论。具体而言,我们构造了一种 PGD 攻击,将 logits 乘以一个正标量,在仅于 CIFAR-10 上训练时,将 GAIRAT 准确率从 55% 降至 44%。在本报告中,我们严格评估了该模型,并深入分析了 GAIRAT 对此对抗攻击脆弱性的原因。用于复现我们评估的代码发布于 https://github.com/giuxhub/GAIRAT-LSA
引用
@article{arxiv.2103.01914,
title = {Evaluating the Robustness of Geometry-Aware Instance-Reweighted Adversarial Training},
author = {Dorjan Hitaj and Giulio Pagnotta and Iacopo Masi and Luigi V. Mancini},
journal= {arXiv preprint arXiv:2103.01914},
year = {2021}
}
备注
6 pages, 2 figures, 1 table