安全行事:带弃判选项的对抗鲁棒性
机器学习
2019-11-27 v1 人工智能
机器学习
摘要
我们探讨了在分类器可在对抗样本上弃判(即不输出任何类别)这一可接受设定下的对抗鲁棒性。对抗样本是对分类器正常输入的小扰动,会导致分类器给出错误输出;它们给机器学习系统带来了安全与挑战。在许多安全关键应用中,分类器在对抗样本上弃判的代价低于对其给出错误输出的代价。我们首先引入一种带弃判选项的对抗鲁棒性新目标函数,其刻画了鲁棒性与准确率之间的显式权衡。然后我们提出一个简单基线:一个对抗训练的分类器在距决策边界一定距离内的所有输入上弃判,我们从理论与实验上对其进行了评估。最后,我们提出联合弃判鲁棒性学习(CARL),一种联合学习分类器及其应在输入空间上弃判区域的方法。我们探索了在弃判设定下针对 CARL 的 PGD 与 DeepFool 对抗攻击的不同变体。针对这些攻击进行评估,我们证明使用 CARL 训练得到的分类器比基线更准确、鲁棒且高效。
引用
@article{arxiv.1911.11253,
title = {Playing it Safe: Adversarial Robustness with an Abstain Option},
author = {Cassidy Laidlaw and Soheil Feizi},
journal= {arXiv preprint arXiv:1911.11253},
year = {2019}
}