CUDA:基于卷积的不可学习数据集
机器学习
2023-03-09 v1 密码学与安全
计算机视觉与模式识别
摘要
现代深度学习模型的大规模训练严重依赖网络上公开可用的数据。这种潜在未经授权使用在线数据引发了关于数据隐私的担忧。近期工作旨在通过添加小型专门设计的噪声来为深度学习模型制造不可学习数据以应对此问题。然而,这些方法易受对抗训练(AT)攻击和/或计算繁重。本工作中,我们提出一种新颖、无模型、基于卷积的不可学习数据集(CUDA)生成技术。CUDA通过使用经私钥随机生成的滤波器进行受控的按类卷积生成。CUDA促使网络学习与滤波器及标签的关系,而非用于分类干净数据的可判别特征。我们开展了一些理论分析,证明CUDA可通过降低最优贝叶斯分类器的干净数据性能来成功毒化高斯混合数据。我们还用多种数据集(CIFAR-10、CIFAR-100、ImageNet-100与Tiny-ImageNet)和架构(ResNet-18、VGG-16、Wide ResNet-34-10、DenseNet-121、DeIT、EfficientNetV2-S与MobileNetV2)实证展示了CUDA的有效性。我们的实验表明CUDA对各类数据增强与训练方法(如平滑、具不同预算的AT、迁移学习与微调)均鲁棒。例如,在ImageNet-100 CUDA上训练ResNet-18,采用经验风险最小化(ERM)、 AT与 AT分别仅取得8.96、40.08与20.58的干净测试准确率。此处,在干净训练数据上的ERM取得80.66干净测试准确率。CUDA即使在仅扰动部分训练数据集时,也通过ERM展现出不可学习效应。此外,我们还表明CUDA对专门设计以破解它的自适应防御具有鲁棒性。
引用
@article{arxiv.2303.04278,
title = {CUDA: Convolution-based Unlearnable Datasets},
author = {Vinu Sankar Sadasivan and Mahdi Soltanolkotabi and Soheil Feizi},
journal= {arXiv preprint arXiv:2303.04278},
year = {2023}
}
备注
CVPR 2023