基于后门水印的黑盒数据集所有权验证
密码学与安全
2023-04-03 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
深度学习,尤其是深度神经网络(DNNs),因其高效性与高有效性,已在许多关键应用中被广泛且成功地采用。DNNs 的快速发展得益于一些高质量数据集(例如 ImageNet)的存在,它们使研究者和开发者能够轻松验证其方法的性能。目前,几乎所有已发布的数据集都要求仅可用于学术或教育目的,未经许可不得用于商业目的。然而,仍没有好的方式来确保这一点。在本文中,我们将已发布数据集的保护表述为验证它们是否被用于训练一个(可疑的)第三方模型,其中防御者只能查询该模型,而无法获知其参数与训练细节。基于该表述,我们提出通过后端水印嵌入外部模式以进行所有权验证来保护它们。我们的方法包含两个主要部分:数据集水印与数据集验证。具体而言,我们利用仅投毒后门攻击(例如 BadNets)进行数据集水印,并设计了一种假设检验引导的方法用于数据集验证。我们还提供了一些关于方法的理论分析。在多个不同任务的基准数据集上进行了实验,验证了方法的有效性。复现主要实验的代码见 \url{https://github.com/THUYimingLi/DVBW}。
引用
@article{arxiv.2209.06015,
title = {Black-box Dataset Ownership Verification via Backdoor Watermarking},
author = {Yiming Li and Mingyan Zhu and Xue Yang and Yong Jiang and Tao Wei and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2209.06015},
year = {2023}
}
备注
This paper is accepted by IEEE TIFS. 15 pages. The preliminary short version of this paper was posted on arXiv (arXiv:2010.05821) and presented in a non-archival NeurIPS Workshop (2020)