通过后门水印保护开源数据集
密码学与安全
2020-11-20 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
深度学习的快速发展得益于一些高质量开源数据集(例如 ImageNet)的发布,使研究者能轻松验证其算法的有效性。几乎所有现有开源数据集都要求仅可用于学术或教育目的而非商业目的,然而仍无良好方式保护它们。本文提出一种基于后门嵌入的数据集水印方法,通过验证开源图像分类数据集是否被用于训练第三方模型来保护它。具体地,所提方法包含两个主要过程:数据集水印与数据集验证。我们采用经典的基于投毒的后门攻击(例如 BadNets)进行数据集水印,即通过在一些良性样本上添加特定触发器(例如局部补丁)并标注预定义目标类来生成投毒样本。基于所提基于后门的水印,我们使用由可疑第三方模型对良性样本及其对应水印样本(即带触发器的图像)在目标类上生成的后验概率的假设检验引导方法进行数据集验证。在一些基准数据集上的实验验证了所提方法的有效性。
引用
@article{arxiv.2010.05821,
title = {Open-sourced Dataset Protection via Backdoor Watermarking},
author = {Yiming Li and Ziqi Zhang and Jiawang Bai and Baoyuan Wu and Yong Jiang and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2010.05821},
year = {2020}
}
备注
Accepted by the NeurIPS Workshop on Dataset Curation and Security, 2020. 6 pages