中文

保护数据集知识产权免受未授权使用

密码学与安全 2023-05-26 v1

摘要

训练高性能深度神经网络(DNN)模型需要大规模高质量数据集。收集和标注大规模数据集的高昂成本使得有价值的数据集可被视作数据集所有者的知识产权(IP)。迄今为止,几乎所有针对深度学习的版权保护方案都聚焦于模型的版权保护,而数据集的版权保护鲜有研究。本文提出一种新方法,主动保护数据集免遭未授权用于训练DNN模型。在CIFAR-10和TinyImageNet数据集上的实验结果证明了所提方法的有效性。与在干净数据集上训练的模型相比,所提方法能将在受保护数据集上训练的非授权模型在CIFAR-10和TinyImageNet上的测试准确率分别从86.21%降至38.23%、从74.00%降至16.20%。

关键词

引用

@article{arxiv.2109.07921,
  title  = {Protect the Intellectual Property of Dataset against Unauthorized Use},
  author = {Mingfu Xue and Yinghao Wu and Yushu Zhang and Jian Wang and Weiqiang Liu},
  journal= {arXiv preprint arXiv:2109.07921},
  year   = {2023}
}