中文

级联鲁棒分类器的隐患

机器学习 2022-10-21 v2

摘要

集成可证明鲁棒神经网络是提高神经模型认证鲁棒精度的一种有前景的方法。黑盒集成在预测期间仅假设对组成模型(及其鲁棒性认证器)的查询访问,因其模块化结构而尤其具有吸引力。级联集成是黑盒集成的一种流行实例,在实践中似乎能提高认证鲁棒精度。然而,我们表明级联集成所使用的鲁棒性认证器是不健全的。也就是说,当级联集成在某输入 xx(关于 ϵ\epsilon)被认证为局部鲁棒时,在以 xx 为中心的 ϵ\epsilon-球中可能存在输入 xx',使得级联在 xx' 处的预测不同于 xx,从而该集成并非局部鲁棒。我们的理论发现伴有实证结果,进一步证明了这种不健全性。我们提出级联攻击(CasA),一种针对级联集成的对抗攻击,并表明:(1) 在集成声称可证明鲁棒且准确的样本中,多达 88% 存在对抗输入;(2) 当集成声称在 97% 的测试集上可证明鲁棒且准确时,在我们的攻击下级联集成的准确率可低至 11%。我们的工作通过表明级联这一看似有益的策略实际上会损害所得集成的鲁棒性,揭示了级联可证明鲁棒模型的一个关键缺陷。我们的代码可在 \url{https://github.com/TristaChi/ensembleKW} 获取。

关键词

引用

@article{arxiv.2206.00278,
  title  = {On the Perils of Cascading Robust Classifiers},
  author = {Ravi Mangal and Zifan Wang and Chi Zhang and Klas Leino and Corina Pasareanu and Matt Fredrikson},
  journal= {arXiv preprint arXiv:2206.00278},
  year   = {2022}
}