中文

集成对抗训练:攻击与防御

机器学习 2020-04-28 v5 密码学与安全 机器学习

摘要

对抗样本是旨在欺骗机器学习模型的扰动输入。对抗训练将此类样本注入训练数据以提升鲁棒性。为将此技术扩展至大规模数据集,扰动通常使用最大化模型损失线性近似的快速单步方法生成。我们证明这种形式的对抗训练会收敛到一个退化的全局最小值,其中数据点附近的小曲率伪影掩盖了损失的线性近似。模型因此学会生成弱扰动,而非防御强扰动。结果我们发现,对抗训练在面对黑盒攻击(即迁移在未防御模型上计算的扰动)以及一种强大的新型单步攻击(通过小随机步长逃离输入数据非平滑邻域)时仍然脆弱。我们进一步提出集成对抗训练,这是一种利用从其他模型迁移的扰动来增强训练数据的技术。在 ImageNet 上,集成对抗训练产生的模型对黑盒攻击具有强鲁棒性。特别是,我们最鲁棒的模型赢得了 NIPS 2017 对抗攻击防御竞赛的第一轮。然而,后续工作发现更复杂的黑盒攻击可显著增强可迁移性并降低我们模型的准确率。

关键词

引用

@article{arxiv.1705.07204,
  title  = {Ensemble Adversarial Training: Attacks and Defenses},
  author = {Florian Tramèr and Alexey Kurakin and Nicolas Papernot and Ian Goodfellow and Dan Boneh and Patrick McDaniel},
  journal= {arXiv preprint arXiv:1705.07204},
  year   = {2020}
}

备注

22 pages, 5 figures, International Conference on Learning Representations (ICLR) 2018 (amended in April 2020 to include subsequent attacks that significantly reduced the robustness of our models)