中文

MEA-Defender:一种针对模型提取攻击的鲁棒水印

密码学与安全 2024-01-30 v1 机器学习

摘要

近年来,许多高价值的深度神经网络(DNN)通过深度学习算法训练而成。为了保护原始所有者对此类DNN模型的知识产权(IP),基于后门的水印已被广泛研究。然而,大多数此类水印在模型提取攻击下失效,模型提取攻击利用输入样本查询目标模型并获取相应输出,从而使用这些输入-输出对训练替代模型。在本文中,我们提出了一种新颖的水印来保护DNN模型的知识产权免受模型提取攻击,命名为MEA-Defender。具体来说,我们通过组合输入域中两个源类别的两个样本来获得水印,并设计了一个水印损失函数,使水印的输出域位于主任务样本的输出域之内。由于我们水印的输入域和输出域都是主任务样本的输入域和输出域不可或缺的一部分,因此在模型提取过程中,水印将与主任务一起被提取到被盗模型中。我们在四种模型提取攻击上进行了大量实验,使用了五个数据集和基于监督学习和自监督学习算法训练的六个模型。实验结果表明,MEA-Defender对不同的模型提取攻击以及各种水印移除/检测方法具有高度鲁棒性。

关键词

引用

@article{arxiv.2401.15239,
  title  = {MEA-Defender: A Robust Watermark against Model Extraction Attack},
  author = {Peizhuo Lv and Hualong Ma and Kai Chen and Jiachen Zhou and Shengzhi Zhang and Ruigang Liang and Shenchen Zhu and Pan Li and Yingjun Zhang},
  journal= {arXiv preprint arXiv:2401.15239},
  year   = {2024}
}

备注

To Appear in IEEE Symposium on Security and Privacy 2024 (IEEE S&P 2024), MAY 20-23, 2024, SAN FRANCISCO, CA, USA