中文

不可学习样本:使个人数据无法被利用

机器学习 2021-02-26 v2 密码学与安全 计算机视觉与模式识别 机器学习

摘要

互联网上“免费”数据的数量一直是当前深度学习取得成功的关键。然而,这也引发了关于未经授权利用个人数据训练商业模型的隐私担忧。因此,开发防止未经授权数据利用的方法至关重要。本文提出一个问题:数据能否对深度学习模型变得不可学习?我们提出了一种确实能使训练样本不可学习的“误差最小化”噪声。误差最小化噪声被有意生成,以将一个或多个训练样本的错误降低到接近零,从而欺骗模型相信从这些样本中“无物可学”。该噪声被限制为对人眼不可感知,因此不影响数据的正常效用。我们通过实验验证了误差最小化噪声在样本级和类别级两种形式下的有效性。我们还展示了其在广泛实验设置下的灵活性,以及在人脸识别案例研究中的实用性。我们的工作为使得个人数据对深度学习模型不可利用迈出了重要的第一步。

关键词

引用

@article{arxiv.2101.04898,
  title  = {Unlearnable Examples: Making Personal Data Unexploitable},
  author = {Hanxun Huang and Xingjun Ma and Sarah Monazam Erfani and James Bailey and Yisen Wang},
  journal= {arXiv preprint arXiv:2101.04898},
  year   = {2021}
}

备注

ICLR2021, In International Conference on Learning Representations