基于生成对抗网络检测并去除深度神经网络中的水印
多媒体
2022-07-05 v1 机器学习
图像与视频处理
摘要
深度神经网络(DNN)已在多个领域取得显著性能。然而,从头训练一个 DNN 模型需要大量计算资源与训练数据。大多数个人用户难以获得此类计算资源与训练数据。模型版权侵权是近年来出现的问题。例如,预训练模型可能在未经模型所有者授权的情况下被非法用户窃取或滥用。近来,许多关于保护 DNN 模型知识产权的工作被提出。在这些工作中,基于后门向 DNN 嵌入水印是广泛使用的方法之一。然而,当 DNN 模型被窃取时,基于后门的水印可能面临被对手检测并去除的风险。本文中,我们提出一种通过生成对抗网络(GAN)检测并去除深度神经网络中水印的方案。我们证明基于后门的 DNN 水印易受所提出的基于 GAN 的水印去除攻击。该攻击方法包括两个阶段。第一阶段,我们使用 GAN 与少量干净图像检测并反推 DNN 模型中的水印。第二阶段,我们基于反推得到的后门图像对带水印的 DNN 进行微调。在 MNIST 与 CIFAR10 数据集上的实验评估表明,所提方法可有效去除 DNN 模型中约 98% 的水印,应用该攻击后水印保留率从 100% 降至低于 2%。同时,该攻击几乎不影响模型性能。带水印的 DNN 在 MNIST 与 CIFAR10 数据集上的测试准确率分别下降不到 1% 与 3%。
引用
@article{arxiv.2106.08104,
title = {Detect and remove watermark in deep neural networks via generative adversarial networks},
author = {Haoqi Wang and Mingfu Xue and Shichang Sun and Yushu Zhang and Jian Wang and Weiqiang Liu},
journal= {arXiv preprint arXiv:2106.08104},
year = {2022}
}