中文

从基于卷积的不可学习数据集中学习

机器学习 2025-05-09 v2 计算机视觉与模式识别

摘要

构建用于深度学习的大规模数据集引发了关于在线数据未经授权使用的担忧,导致保护数据免受第三方用于训练的兴趣日益增加。基于卷积的不可学习数据集(CUDA)方法旨在通过对数据集中每张图像施加逐类模糊,使神经网络学习模糊核与标签之间的关系,而非学习用于分类干净数据的信息特征。在本工作中,我们评估了CUDA数据在图像锐化和频率滤波后是否仍保持不可学习性,发现这种简单变换的组合提升了CUDA数据用于训练的效用。特别地,我们观察到,与对抗训练相比,使用CUDA不可学习数据训练的模型在CIFAR-10、CIFAR-100和ImageNet-100上的测试准确率有显著提升。在利用不可学习数据训练模型达到高准确率的过程中,我们强调了持续改进数据投毒技术以确保数据隐私的必要性。我们的方法通过指出简单方法如锐化和频率滤波即可破坏基于卷积的不可学习数据集,为增强不可学习数据集的鲁棒性开辟了新途径。

关键词

引用

@article{arxiv.2411.01742,
  title  = {Learning from Convolution-based Unlearnable Datasets},
  author = {Dohyun Kim and Pedro Sandoval-Segura},
  journal= {arXiv preprint arXiv:2411.01742},
  year   = {2025}
}

备注

Accepted to AdvML-Frontiers Workshop at NeurIPS 2024. Code available at https://github.com/aseriesof-tubes/RSK