Logit配对方法可欺骗基于梯度的攻击
机器学习
2019-03-13 v3 密码学与安全
机器学习
摘要
最近,Kannan等人[2018]提出了几种logit正则化方法以提升分类器的对抗鲁棒性。我们表明,他们所提出的计算快速方法——干净Logit配对(CLP)与Logit压缩(LSQ)——仅仅使构造对抗样本的基于梯度的优化问题变得更困难,而未提供实际的鲁棒性。我们发现对抗Logit配对(ALP)确实可能提供针对对抗样本的鲁棒性,尤其当与对抗训练结合时,并在多种设置下对其进行了考察。然而,对抗准确率的提升远小于先前所声称的。最后,我们的结果表明,针对迭代PGD攻击的评估严重依赖于所使用参数,并可能导致关于模型鲁棒性的错误结论。
引用
@article{arxiv.1810.12042,
title = {Logit Pairing Methods Can Fool Gradient-Based Attacks},
author = {Marius Mosbach and Maksym Andriushchenko and Thomas Trost and Matthias Hein and Dietrich Klakow},
journal= {arXiv preprint arXiv:1810.12042},
year = {2019}
}
备注
Accepted to NeurIPS 2018 Workshop on Security in Machine Learning