用于缓解通用对抗扰动的Jacobian正则化
机器学习
2021-09-14 v2 人工智能
密码学与安全
计算机视觉与模式识别
摘要
通用对抗扰动(UAPs)是能对神经网络在大量数据上实施欺骗的输入扰动。它们是一类攻击,因促成对神经网络真实、实用且低成本的攻击而构成重大威胁。本工作中,我们基于数据依赖Jacobian的范数推导了UAPs有效性的上界。我们通过实验验证Jacobian正则化在保持干净性能的同时,将模型对UAPs的鲁棒性提升至最多四倍。我们的理论分析还使我们能 formulate 一种度量,用于衡量输入对之间共享对抗扰动的强度。我们将该度量应用于基准数据集,并展示其与实际观测到的鲁棒性高度相关。这表明现实且实用的通用攻击可在不牺牲干净准确率的情况下被可靠缓解,这为机器学习系统的鲁棒性带来了前景。
引用
@article{arxiv.2104.10459,
title = {Jacobian Regularization for Mitigating Universal Adversarial Perturbations},
author = {Kenneth T. Co and David Martinez Rego and Emil C. Lupu},
journal= {arXiv preprint arXiv:2104.10459},
year = {2021}
}
备注
In Proceedings of the 30th International Conference on Artificial Neural Networks (ICANN 2021), related code available at: https://github.com/kenny-co/sgd-uap-torch