学习不可学:对抗增强抑制不可学样本攻击
机器学习
2023-03-28 v1 密码学与安全
计算机视觉与模式识别
摘要
不可学样本攻击是一种数据投毒技术,可用于保护公共数据免遭未经授权用于训练深度学习模型。这些方法向原始图像添加隐蔽扰动,从而使深度学习模型难以从这些训练数据中有效学习。当前研究表明,对抗训练可在一定程度上缓解不可学样本攻击的影响,而常规数据增强方法对此类投毒无效。然而,对抗训练需要大量计算资源,并可能导致非平凡的精度损失。本文中,我们引入UEraser方法,通过有效数据增强策略与最大化损失的对抗增强相结合,优于当前针对各类最先进不可学样本攻击的防御。与当前SOTA对抗训练方法形成鲜明对比,UEraser使用对抗增强,其超越了当前不可学攻击与防御所假设的 扰动预算限制。它还有助于提升模型泛化能力,从而防止精度损失。UEraser通过最大化误差的数据增强消除不可学效应,从而恢复训练模型精度。有趣的是,UEraser-Lite——一种无对抗增强的快速变体,在保持干净精度方面同样高度有效。在由多种攻击生成的具有挑战性的不可学CIFAR-10、CIFAR-100、SVHN和ImageNet-subset数据集上,其取得了与干净训练相当的结果。我们还展示了其针对可能的自适应攻击的有效性。我们的代码开源并可供深度学习社区使用:https://github.com/lafeat/ueraser。
引用
@article{arxiv.2303.15127,
title = {Learning the Unlearnable: Adversarial Augmentations Suppress Unlearnable Example Attacks},
author = {Tianrui Qin and Xitong Gao and Juanjuan Zhao and Kejiang Ye and Cheng-Zhong Xu},
journal= {arXiv preprint arXiv:2303.15127},
year = {2023}
}
备注
UEraser introduces adversarial augmentations to suppress unlearnable example attacks and outperforms current defenses