中文

对抗训练为何会损害鲁棒准确率

机器学习 2022-03-30 v1 密码学与安全 计算机视觉与模式识别 机器学习

摘要

具有高测试准确率的机器学习分类器在对抗攻击下往往表现糟糕。人们通常认为对抗训练可缓解此问题。在本文中,我们出人意料地证明事实可能恰恰相反——尽管在数据充足时对抗训练有所帮助,但在小样本量情形下它可能会损害鲁棒泛化。我们首先在无噪观测的高维线性分类设定中证明该现象。我们的证明提供了可能也适用于特征学习模型的解释性见解。此外,我们在标准图像数据集上的实验观察到,对于有效削弱类别信息(如掩码攻击和物体损坏)的可感知攻击,同样的行为也会发生。

关键词

引用

@article{arxiv.2203.02006,
  title  = {Why adversarial training can hurt robust accuracy},
  author = {Jacob Clarysse and Julia Hörrmann and Fanny Yang},
  journal= {arXiv preprint arXiv:2203.02006},
  year   = {2022}
}