中文

对抗风险与针对弱攻击进行评估的危害

机器学习 2018-06-13 v2 密码学与安全 机器学习

摘要

本文研究了近期提出的防御对抗样本和评估对抗鲁棒性的方法。我们提出以“对抗风险”作为目标,以实现对最坏情况输入具有鲁棒性的模型。随后我们将常用攻击与评估指标构建为真实对抗风险的一个易处理的替代目标。这表明模型可能优化该替代目标而非真实对抗风险。我们将此概念形式化为“对对抗者的遮蔽”,并开发了用于识别被遮蔽模型和设计透明模型的工具与启发式方法。我们通过将无梯度优化技术改造为对抗攻击,在实践中证明了这是一个显著问题;利用这些攻击,我们将若干近期提出的防御方法的准确率降至接近零。我们希望我们的公式与结果能帮助研究者开发更强大的防御。

关键词

引用

@article{arxiv.1802.05666,
  title  = {Adversarial Risk and the Dangers of Evaluating Against Weak Attacks},
  author = {Jonathan Uesato and Brendan O'Donoghue and Aaron van den Oord and Pushmeet Kohli},
  journal= {arXiv preprint arXiv:1802.05666},
  year   = {2018}
}