分类器对抗对抗性操纵鲁棒性的形式化保证
机器学习
2017-11-07 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
近期工作表明,state-of-the-art 分类器相当脆弱,即对原本以高置信度正确分类的输入进行微小的对抗性改变,会使其再次以高置信度被错误分类。这引发了人们对此类分类器易受攻击的担忧,并对其在安全关键系统中的使用提出质疑。我们在本文中首次给出了分类器鲁棒性的形式化保证,通过提供改变分类器决策所需输入操纵范数的实例特定下界。基于此分析,我们提出了 Cross-Lipschitz 正则化泛函。我们表明,在核方法或神经网络中使用这种形式的正则化,可以在预测性能无任何损失的情况下提高分类器的鲁棒性。
引用
@article{arxiv.1705.08475,
title = {Formal Guarantees on the Robustness of a Classifier against Adversarial Manipulation},
author = {Matthias Hein and Maksym Andriushchenko},
journal= {arXiv preprint arXiv:1705.08475},
year = {2017}
}
备注
final version accepted at NIPS 2017, fixed bug in implementation of Cross-Lipschitz regularization and lower bound computation, now results are better