中文

域水印:行之有效且无害的数据集版权保护近在咫尺

计算机视觉与模式识别 2023-11-07 v2 人工智能 密码学与安全 机器学习

摘要

深度神经网络(DNN)的繁荣很大程度上受益于开源数据集,用户可基于这些数据集评估并改进其方法。本文重新审视基于后门的数据集所有权验证(DOV),其目前是保护开源数据集版权的唯一可行途径。我们揭示这些方法从根本上是有害的,因为它们会被对手利用,向带水印的 DNN 引入恶意的误分类行为。本文从另一视角设计 DOV:使在水印化模型(在受保护数据集上训练)能正确分类一些被良性模型误分类的“困难”样本。我们的方法受 DNN 泛化性质启发,我们为原始数据集找到了一个难以泛化的域(作为其域水印)。它可借助包含修改样本的保护数据集轻松学习。具体而言,我们将域生成表述为双层优化,并提出优化一组视觉上不可区分的干净标签修改数据,其效果类似于来自难以泛化域的域水印样本,以确保水印隐蔽性。我们还通过域水印设计了假设检验引导的所有权验证,并给出了方法的理论分析。在三个基准数据集上的大量实验验证了我们方法的有效性及其对潜在自适应方法的抵抗能力。复现主要实验的代码见 \url{https://github.com/JunfengGo/Domain-Watermark}。

关键词

引用

@article{arxiv.2310.14942,
  title  = {Domain Watermark: Effective and Harmless Dataset Copyright Protection is Closed at Hand},
  author = {Junfeng Guo and Yiming Li and Lixu Wang and Shu-Tao Xia and Heng Huang and Cong Liu and Bo Li},
  journal= {arXiv preprint arXiv:2310.14942},
  year   = {2023}
}

备注

This paper is accepted by NeurIPS 2023. The first two authors contributed equally to this work. 30 pages