中文

用于对抗鲁棒性的深度排斥原型

机器学习 2021-05-27 v1

摘要

尽管已有许多针对对抗样本的防御方法被提出,寻找鲁棒的机器学习模型仍是一个开放问题。迄今为止最具说服力的防御方法是对抗训练,其通过将对抗样本补充到训练数据集中来实现。然而,对抗训练严重影响了训练时间,并且依赖于找到有代表性的对抗样本。在本文中,我们提出在具有大类间分离度的输出空间上训练模型,以在不进行对抗训练的情况下获得鲁棒性。我们引入了一种将输出空间划分为具有大间隔的类原型并训练模型以保持该间隔的方法。实验结果表明,使用这些原型(我们称之为深度排斥原型)训练的模型所获得的鲁棒性与对抗训练相当,同时在自然样本上保持了更高的准确率。此外,这些模型对大扰动尺寸更具弹性。例如,我们在 CIFAR-10 上获得了超过 50% 的鲁棒性,自然样本准确率为 92%;在 CIFAR-100 上获得了超过 20% 的鲁棒性,自然样本准确率为 71%,且均未使用对抗训练。对于这两个数据集,模型在面对大扰动时保持鲁棒性的能力优于对抗训练模型。

关键词

引用

@article{arxiv.2105.12427,
  title  = {Deep Repulsive Prototypes for Adversarial Robustness},
  author = {Alex Serban and Erik Poll and Joost Visser},
  journal= {arXiv preprint arXiv:2105.12427},
  year   = {2021}
}