中文

Mendata: 一个净化被篡改训练数据的框架

密码学与安全 2023-12-05 v1 机器学习

摘要

用于训练模型的不可信数据可能已被篡改,以赋予学习模型隐藏属性,数据贡献者日后可能利用这些属性。数据净化旨在模型训练前去除此类篡改。我们提出了 Mendata,一个用于净化被篡改训练数据的新颖框架。Mendata 以一个绝大多数输入均为干净数据的小型参考数据集为起点,对训练输入施加扰动,使其保留效用但分布(以 Wasserstein 距离衡量)与参考数据相似,从而消除学习模型中的隐藏属性。一个关键挑战是如何寻找此类扰动,我们通过将其表述为一个极小极大优化问题,并开发一种两步法进行迭代求解来解决这一挑战。我们通过将 Mendata 应用于击败最先进的数据投毒与数据追踪技术,证明了其有效性。

关键词

引用

@article{arxiv.2312.01281,
  title  = {Mendata: A Framework to Purify Manipulated Training Data},
  author = {Zonghao Huang and Neil Gong and Michael K. Reiter},
  journal= {arXiv preprint arXiv:2312.01281},
  year   = {2023}
}