不致命于训练的攻击使对抗学习更鲁棒
机器学习
2020-09-08 v2 机器学习
摘要
基于极小极大形式的对抗训练对于获得训练模型的对抗鲁棒性是必要的。然而,它是保守甚至悲观的,以至于有时会损害自然泛化能力。在本文中,我们提出一个基本问题——我们是否必须为了对抗鲁棒性而牺牲自然泛化?我们认为对抗训练是利用置信对抗数据来更新当前模型。我们提出一种友好对抗训练(FAT)的新方法:我们不是在最大化损失的对抗数据中寻找,而是在被置信误分类的对抗数据中寻找最小化损失的 least adversarial(即友好对抗)数据。我们的新公式易于实现,只需提前停止如 PGD(投影梯度下降)这类最对抗数据搜索算法,我们称之为 early-stopped PGD。理论上,FAT 由对抗风险的上界所证明。经验上,early-stopped PGD 使我们能够否定地回答先前的问题——对抗鲁棒性确实可以在不损害自然泛化的情况下实现。
引用
@article{arxiv.2002.11242,
title = {Attacks Which Do Not Kill Training Make Adversarial Learning Stronger},
author = {Jingfeng Zhang and Xilie Xu and Bo Han and Gang Niu and Lizhen Cui and Masashi Sugiyama and Mohan Kankanhalli},
journal= {arXiv preprint arXiv:2002.11242},
year = {2020}
}
备注
Thirty-seventh International Conference on Machine Learning (ICML 2020)