基于交叉熵的白盒对抗攻击在超拟合下将失效
机器学习
2022-05-17 v2 人工智能
密码学与安全
摘要
深度神经网络因其强大的性能而被广泛应用于各个领域。然而,近期研究表明深度学习模型易受对抗攻击,即向输入添加轻微扰动会使模型得出错误结果。这对于某些高安全性要求的系统尤为危险,因此本文提出一种新的防御方法,利用模型超拟合状态来提升模型的对抗鲁棒性(即对抗攻击下的准确率)。本文从数学上证明了超拟合的有效性,并通过最小化不相关类别分数(MUCS)使模型快速达到该状态。理论上,超拟合可抵御任何现有的(乃至未来的)基于 CE 的白盒对抗攻击。此外,本文使用多种强力攻击算法评估超拟合的对抗鲁棒性,并将所提方法与近期会议中近 50 种防御模型进行比较。实验结果表明,本文的超拟合方法可使训练后的模型获得最高的对抗鲁棒性。
引用
@article{arxiv.2205.02741,
title = {CE-based white-box adversarial attacks will not work using super-fitting},
author = {Youhuan Yang and Lei Sun and Leyu Dai and Song Guo and Xiuqing Mao and Xiaoqin Wang and Bayi Xu},
journal= {arXiv preprint arXiv:2205.02741},
year = {2022}
}