Mendata: 一个净化被篡改训练数据的框架
密码学与安全
2023-12-05 v1 机器学习
摘要
用于训练模型的不可信数据可能已被篡改,以赋予学习模型隐藏属性,数据贡献者日后可能利用这些属性。数据净化旨在模型训练前去除此类篡改。我们提出了 Mendata,一个用于净化被篡改训练数据的新颖框架。Mendata 以一个绝大多数输入均为干净数据的小型参考数据集为起点,对训练输入施加扰动,使其保留效用但分布(以 Wasserstein 距离衡量)与参考数据相似,从而消除学习模型中的隐藏属性。一个关键挑战是如何寻找此类扰动,我们通过将其表述为一个极小极大优化问题,并开发一种两步法进行迭代求解来解决这一挑战。我们通过将 Mendata 应用于击败最先进的数据投毒与数据追踪技术,证明了其有效性。
引用
@article{arxiv.2312.01281,
title = {Mendata: A Framework to Purify Manipulated Training Data},
author = {Zonghao Huang and Neil Gong and Michael K. Reiter},
journal= {arXiv preprint arXiv:2312.01281},
year = {2023}
}