中文

面向可证明的对抗样本检测

机器学习 2020-02-21 v1 密码学与安全 机器学习

摘要

卷积神经网络(CNN)已被部署于越来越多的分类系统中,但对抗样本可被恶意构造以欺骗它们,并正成为一种现实威胁。已有多种提升 CNN 对抗鲁棒性的方案,但它们均存在性能损失或其他局限。本文以可证明的对抗检测方案——可证明禁忌陷阱(Certifiable Taboo Trap, CTT)的形式,提供了一种新思路。在训练数据与测试数据同分布的合理假设下,该系统可对特定 ll_{\infty} 尺寸的对抗输入提供可证明的检测保证。我们开发并评估了多个版本的 CTT,其在防御能力、训练开销与对抗样本可证明性方面各有不同。针对具有各种 lpl_p 范数的对手,CTT 优于仅聚焦于提升网络鲁棒性的现有防御方法。我们表明,CTT 在干净测试数据上假阳性率很低,部署时计算开销极小,且可支持复杂安全策略。

关键词

引用

@article{arxiv.2002.08740,
  title  = {Towards Certifiable Adversarial Sample Detection},
  author = {Ilia Shumailov and Yiren Zhao and Robert Mullins and Ross Anderson},
  journal= {arXiv preprint arXiv:2002.08740},
  year   = {2020}
}