中文

认证模型集成的联合对抗鲁棒性

机器学习 2020-04-23 v1 密码学与安全 机器学习

摘要

深度神经网络(DNNs)通常易受对抗样本攻击。若干提出的防御方法部署模型集成,希望尽管单个模型可能脆弱,但攻击者无法找到对集成成功的对抗样本。根据集成使用方式,攻击者可能需要找到一个对集成中所有或多数模型均成功的单一对抗样本。集成防御对强攻击者的有效性取决于集成中模型的脆弱性空间互不相交。我们考虑模型集成的联合脆弱性,并提出一种基于先前单模型鲁棒性认证工作的新技术,用于认证集成的联合鲁棒性。我们评估了多种模型集成的鲁棒性,包括使用代价敏感鲁棒性训练以实现多样性的模型,以增进对集成模型作为对抗样本防御的潜在有效性的理解。

关键词

引用

@article{arxiv.2004.10250,
  title  = {Certifying Joint Adversarial Robustness for Model Ensembles},
  author = {Mainuddin Ahmad Jonas and David Evans},
  journal= {arXiv preprint arXiv:2004.10250},
  year   = {2020}
}

备注

Open source code for our implementation and for reproducing our experiments is available at https://github.com/jonas-maj/ensemble-adversarial-robustness