中文

防止专有数据未授权使用:面向安全数据集发布的数据投毒

密码学与安全 2021-03-08 v2 机器学习

摘要

社交媒体等大型组织持续发布数据,例如用户图像。同时,这些组织利用其发布的海量语料训练专有模型,从而在竞争对手中保持优势。这两种行为可能相互冲突,因为组织希望阻止竞争对手使用其自有数据来复现专有模型的性能。我们通过开发一种数据投毒方法解决该问题,该方法可对公开发布的数据进行最小改动,以防止他人在其上训练模型。此外,我们的方法可在线上使用,使公司能在发布数据时实时保护其数据。我们在 ImageNet 分类和人脸识别上展示了该方法的有效性。

关键词

引用

@article{arxiv.2103.02683,
  title  = {Preventing Unauthorized Use of Proprietary Data: Poisoning for Secure Dataset Release},
  author = {Liam Fowl and Ping-yeh Chiang and Micah Goldblum and Jonas Geiping and Arpit Bansal and Wojtek Czaja and Tom Goldstein},
  journal= {arXiv preprint arXiv:2103.02683},
  year   = {2021}
}