中文

评估集成模型对对抗攻击的鲁棒性

机器学习 2020-05-13 v1 机器学习

摘要

对抗样本是通过微小扰动输入以诱骗神经网络的样本,已知其可在模型间迁移;对某一模型有效的对抗攻击通常也能欺骗另一模型。这种可迁移性概念引发了严重的安全担忧,因为它使得在目标模型内部参数未知的黑盒设置下攻击模型成为可能。在本文中,我们致力于分析并最小化集成模型内各模型间对抗攻击的可迁移性。为此,我们引入了一种基于梯度的度量方法,用于衡量集成模型的各组成模型如何有效协作以缩小针对该集成模型自身的对抗样本空间。此外,我们证明该度量可在训练阶段加以利用,以提升集成模型对对抗样本的鲁棒性。

关键词

引用

@article{arxiv.2005.05750,
  title  = {Evaluating Ensemble Robustness Against Adversarial Attacks},
  author = {George Adam and Romain Speciel},
  journal= {arXiv preprint arXiv:2005.05750},
  year   = {2020}
}