认证 $\ell_p$ 鲁棒性是否仍值得?
机器学习
2023-10-17 v1
摘要
多年来,研究人员开发了无数利用对抗样本普遍性的攻击方法,以及旨在防范此类攻击所带来安全漏洞的防御方法。本文特别关注提供针对 有界攻击类的可证明保证的防御。认证防御已取得显著进展,将鲁棒性认证从玩具模型和数据集带到 ImageNet 分类等大规模问题。虽然这无疑是一个有趣的学术问题,但随着该领域的成熟,其在实际中的影响仍不明确,因此我们觉得重新审视继续该研究方向动机是有益的。本文探讨了这一探究的三个层面:(1) 我们为何关注鲁棒性研究?(2) 我们为何关注 有界威胁模型?以及 (3) 我们为何关注认证而非经验性防御?简而言之,我们认为局部鲁棒性认证确实为机器学习领域赋予了实际价值。我们尤其关注上述后两个问题。关于前者,我们认为 有界威胁模型构成了在安全关键领域安全应用模型的最低要求,同时,越来越多的证据表明局部鲁棒性可能带来与鲁棒性无直接关联的下游外部益处。至于后者,我们认为 (i) 认证解决了对抗攻击的猫鼠游戏;并且进一步,(ii) 可能与普遍看法相反,在准确性、鲁棒性和认证性之间可能不存在根本的权衡,而且认证训练技术构成了学习鲁棒模型的一种特别有前景的方式。
引用
@article{arxiv.2310.09361,
title = {Is Certifying $\ell_p$ Robustness Still Worthwhile?},
author = {Ravi Mangal and Klas Leino and Zifan Wang and Kai Hu and Weicheng Yu and Corina Pasareanu and Anupam Datta and Matt Fredrikson},
journal= {arXiv preprint arXiv:2310.09361},
year = {2023}
}