中文

安全行事:带弃判选项的对抗鲁棒性

机器学习 2019-11-27 v1 人工智能 机器学习

摘要

我们探讨了在分类器可在对抗样本上弃判(即不输出任何类别)这一可接受设定下的对抗鲁棒性。对抗样本是对分类器正常输入的小扰动,会导致分类器给出错误输出;它们给机器学习系统带来了安全与挑战。在许多安全关键应用中,分类器在对抗样本上弃判的代价低于对其给出错误输出的代价。我们首先引入一种带弃判选项的对抗鲁棒性新目标函数,其刻画了鲁棒性与准确率之间的显式权衡。然后我们提出一个简单基线:一个对抗训练的分类器在距决策边界一定距离内的所有输入上弃判,我们从理论与实验上对其进行了评估。最后,我们提出联合弃判鲁棒性学习(CARL),一种联合学习分类器及其应在输入空间上弃判区域的方法。我们探索了在弃判设定下针对 CARL 的 PGD 与 DeepFool 对抗攻击的不同变体。针对这些攻击进行评估,我们证明使用 CARL 训练得到的分类器比基线更准确、鲁棒且高效。

关键词

引用

@article{arxiv.1911.11253,
  title  = {Playing it Safe: Adversarial Robustness with an Abstain Option},
  author = {Cassidy Laidlaw and Soheil Feizi},
  journal= {arXiv preprint arXiv:1911.11253},
  year   = {2019}
}