鲁棒通用对抗扰动
机器学习
2023-06-07 v2 密码学与安全
摘要
通用对抗扰动(UAPs)是不可察觉的、与图像无关的向量,能以高概率使深度神经网络(DNNs)对输入误分类。在实际攻击场景中,对抗扰动在添加到DNN输入之前可能经历像素强度变化、缩放等变换。现有方法无法生成对这些真实世界变换鲁棒的UAPs,从而限制了它们在实际攻击场景中的适用性。在本工作中,我们引入并形式化了对抗真实世界变换鲁棒的UAPs。我们利用概率鲁棒性界构建了一个迭代算法,并构造了对此类由任意子可微变换函数复合生成的变换鲁棒的UAPs。我们在流行的CIFAR-10与ILSVRC 2012数据集上进行了广泛评估,测量我们的UAPs在旋转、对比度变化等广泛常见真实世界变换下的鲁棒性。我们进一步表明,通过使用一组基本变换,我们的方法能很好地泛化到未见过的变换如雾、JPEG压缩等。我们的结果表明,我们的方法生成的UAPs比最先进(SOTA)基线鲁棒性高出至多23%。
引用
@article{arxiv.2206.10858,
title = {Robust Universal Adversarial Perturbations},
author = {Changming Xu and Gagandeep Singh},
journal= {arXiv preprint arXiv:2206.10858},
year = {2023}
}
备注
16 pages, 3 figures