中文

大规模对抗机器学习

计算机视觉与模式识别 2017-02-14 v2 密码学与安全 机器学习 机器学习

摘要

对抗样本是为欺骗机器学习模型而设计的恶意输入。它们通常从一个模型迁移到另一个模型,使得攻击者在不知晓目标模型参数的情况下发动黑盒攻击。对抗训练是在对抗样本上显式训练模型的过程,以使模型对攻击更鲁棒或降低其在干净输入上的测试误差。迄今为止,对抗训练主要应用于小规模问题。在本研究中,我们将对抗训练应用于 ImageNet。我们的贡献包括:(1) 关于如何成功将对抗训练扩展到大型模型和数据集的建议;(2) 观察到对抗训练赋予模型对单步攻击方法的鲁棒性;(3) 发现多步攻击方法的迁移性略低于单步攻击方法,因此单步攻击是发动黑盒攻击的最佳选择;(4) 解决了一个“标签泄漏”效应,该效应导致对抗训练模型在对抗样本上的表现优于在干净样本上的表现,因为对抗样本构建过程使用了真实标签,而模型可以学会利用构建过程中的规律性。

关键词

引用

@article{arxiv.1611.01236,
  title  = {Adversarial Machine Learning at Scale},
  author = {Alexey Kurakin and Ian Goodfellow and Samy Bengio},
  journal= {arXiv preprint arXiv:1611.01236},
  year   = {2017}
}

备注

17 pages, 5 figures