拉格朗日目标函数提升对抗训练中对未预见攻击的泛化能力
机器学习
2021-03-30 v1 计算机视觉与模式识别
摘要
深度学习模型及其实际应用的最新进展引发了人们对这些模型针对对抗样本鲁棒性的担忧。对抗训练(AT)已被证明能有效获得对训练中所用攻击具有鲁棒性的模型。然而,它通常对其他攻击失效,即模型过拟合于训练攻击方案。在本文中,我们对 AT 提出了一个简单的修改以缓解上述问题。更具体地,我们以拉格朗日形式在最小化扰动 范数的同时最大化分类损失。我们认为,基于该方案生成对抗样本可使所学模型获得增强的攻击泛化能力。我们将我们最终模型的鲁棒准确率与训练时未使用的攻击下、与紧密相关的先进 AT 方法进行比较。该比较表明,我们对未见攻击的平均鲁棒准确率在 CIFAR-10 数据集上高出 5.9%,在 ImageNet-100 数据集上高出 3.2%。我们还证明我们的攻击比专为未见攻击泛化设计的其他攻击方案更快,并得出结论该方法对大规模数据集是可行的。
引用
@article{arxiv.2103.15385,
title = {Lagrangian Objective Function Leads to Improved Unforeseen Attack Generalization in Adversarial Training},
author = {Mohammad Azizmalayeri and Mohammad Hossein Rohban},
journal= {arXiv preprint arXiv:2103.15385},
year = {2021}
}