中文

ActiveGuard:一种基于对抗样本的深度学习模型知识产权主动保护技术

密码学与安全 2023-05-26 v1 机器学习

摘要

深度神经网络(DNN)的训练代价高昂,因此 DNN 可被视为模型所有者的知识产权(IP)。迄今为止,大多数现有的保护工作侧重于在 DNN 模型被盗后验证所有权,无法提前抵御盗版。为此,我们提出了一种基于对抗样本抵御 DNN 盗版的主动 DNN IP 保护方法,名为 ActiveGuard。ActiveGuard 旨在通过对抗样本实现授权控制与用户指纹管理,并能够提供所有权验证。具体而言,ActiveGuard 利用精心构造的对抗样本作为用户指纹,以区分授权用户与未授权用户。合法用户可将指纹输入 DNN 进行身份认证与授权使用,而未授权用户由于额外的控制层将获得较差的模型性能。此外,ActiveGuard 使模型所有者能够将水印嵌入 DNN 的权重中。当 DNN 被非法盗版时,模型所有者可提取所嵌入的水印并执行所有权验证。实验结果表明,对于授权用户,LeNet-5 与宽残差网络(WRN)模型的测试准确率分别为 99.15% 和 91.46%,而对于未授权用户,这两个 DNN 的测试准确率分别仅为 8.92%(LeNet-5)和 10%(WRN)。此外,每个授权用户都能以高成功率(高达 100%)通过指纹认证。对于所有权验证,所嵌入的水印可被成功提取,且 DNN 模型的正常性能不受影响。进一步,ActiveGuard 被证明对指纹伪造攻击、模型微调攻击和剪枝攻击具有鲁棒性。

关键词

引用

@article{arxiv.2103.01527,
  title  = {ActiveGuard: An Active DNN IP Protection Technique via Adversarial Examples},
  author = {Mingfu Xue and Shichang Sun and Can He and Yushu Zhang and Jian Wang and Weiqiang Liu},
  journal= {arXiv preprint arXiv:2103.01527},
  year   = {2023}
}