中文

Logit配对方法可欺骗基于梯度的攻击

机器学习 2019-03-13 v3 密码学与安全 机器学习

摘要

最近,Kannan等人[2018]提出了几种logit正则化方法以提升分类器的对抗鲁棒性。我们表明,他们所提出的计算快速方法——干净Logit配对(CLP)与Logit压缩(LSQ)——仅仅使构造对抗样本的基于梯度的优化问题变得更困难,而未提供实际的鲁棒性。我们发现对抗Logit配对(ALP)确实可能提供针对对抗样本的鲁棒性,尤其当与对抗训练结合时,并在多种设置下对其进行了考察。然而,对抗准确率的提升远小于先前所声称的。最后,我们的结果表明,针对迭代PGD攻击的评估严重依赖于所使用参数,并可能导致关于模型鲁棒性的错误结论。

关键词

引用

@article{arxiv.1810.12042,
  title  = {Logit Pairing Methods Can Fool Gradient-Based Attacks},
  author = {Marius Mosbach and Maksym Andriushchenko and Thomas Trost and Matthias Hein and Dietrich Klakow},
  journal= {arXiv preprint arXiv:1810.12042},
  year   = {2019}
}

备注

Accepted to NeurIPS 2018 Workshop on Security in Machine Learning