防止专有数据未授权使用:面向安全数据集发布的数据投毒
密码学与安全
2021-03-08 v2 机器学习
摘要
社交媒体等大型组织持续发布数据,例如用户图像。同时,这些组织利用其发布的海量语料训练专有模型,从而在竞争对手中保持优势。这两种行为可能相互冲突,因为组织希望阻止竞争对手使用其自有数据来复现专有模型的性能。我们通过开发一种数据投毒方法解决该问题,该方法可对公开发布的数据进行最小改动,以防止他人在其上训练模型。此外,我们的方法可在线上使用,使公司能在发布数据时实时保护其数据。我们在 ImageNet 分类和人脸识别上展示了该方法的有效性。
引用
@article{arxiv.2103.02683,
title = {Preventing Unauthorized Use of Proprietary Data: Poisoning for Secure Dataset Release},
author = {Liam Fowl and Ping-yeh Chiang and Micah Goldblum and Jonas Geiping and Arpit Bansal and Wojtek Czaja and Tom Goldstein},
journal= {arXiv preprint arXiv:2103.02683},
year = {2021}
}