中文

数据集推断:机器学习中的所有权判定

机器学习 2021-04-23 v1 密码学与安全 机器学习

摘要

随着机器学习模型训练所涉及的数据与计算量日益增加,此类模型构成了宝贵的知识产权。这激发了人们对模型窃取的兴趣,而基于部分、少量或无监督学习方面的进展使模型窃取更具可行性。现有防御手段侧重于在模型决策面中插入独特水印,但这并不充分:水印并非从训练分布中采样,因此在模型窃取过程中并不总能被保留。本文提出关键观察:被盗模型训练集中所含的知识是所有被盗副本的共同之处。无论采用何种攻击,攻击者的目标始终是提取该知识或其副产品。这赋予原模型所有者相对于攻击者的显著优势:模型所有者可访问原始训练数据。因此我们引入数据集推断(dataset inference),即识别疑似模型副本是否含有原模型数据集私有知识的过程,作为抵御模型窃取的防御手段。我们开发了一种将统计检验与估计多个数据点到决策边界距离的能力相结合的数据集推断方法。我们在 CIFAR10、SVHN、CIFAR100 和 ImageNet 上的实验表明,模型所有者能够以大于 99% 的置信度声称其模型(或事实上其数据集)遭窃取,尽管仅暴露了被盗模型的 50 个训练点。数据集推断可抵御最先进的攻击,即便攻击者为自适应也不例外。与先前工作不同,它无需重新训练或使受防御模型过拟合。

关键词

引用

@article{arxiv.2104.10706,
  title  = {Dataset Inference: Ownership Resolution in Machine Learning},
  author = {Pratyush Maini and Mohammad Yaghini and Nicolas Papernot},
  journal= {arXiv preprint arXiv:2104.10706},
  year   = {2021}
}

备注

Published as a conference paper at ICLR 2021 (Spotlight Presentation)