神经脱水:利用有限数据有效擦除 DNN 黑盒水印
密码学与安全
2024-09-04 v2 人工智能
摘要
为保护训练好的深度神经网络(DNNs)的知识产权,黑盒水印被嵌入到 DNN 模型在一组特制样本上的预测行为中,并仅通过 API 访问从疑似模型提取,已在学术界与工业界日益流行。水印鲁棒性通常针对窃取受保护模型并混淆其参数以移除水印的攻击者实现。然而,当前的鲁棒性评估主要在温和攻击或不现实设定下进行。现有移除攻击仅能破解主流黑盒水印的一小部分,且在四个关键方面存在不足:移除不彻底、依赖水印先验知识、性能下降以及高度依赖数据。本文提出一种称为神经脱水(\textsc{Neural Dehydration},简称 \textsc{Dehydra})的与水印无关的移除攻击,可有效从 DNN 中擦除全部十种主流黑盒水印,且仅需有限甚至无数据依赖。总体上,我们的攻击流程利用受保护模型的内部以恢复并遗忘水印信息。我们进一步设计目标类检测与恢复样本分割算法,以降低效用损失并在五种水印方案上实现无数据水印移除。我们在三个基准数据集与 DNN 架构上针对十种主流黑盒水印对 \textsc{Dehydra} 进行全面评估。相比现有移除攻击,\textsc{Dehydra} 在所覆盖的全部水印上实现强移除效果,在数据有限设定(即少于 训练数据甚至无数据)下保留至少 的窃取模型效用。
引用
@article{arxiv.2309.03466,
title = {Neural Dehydration: Effective Erasure of Black-box Watermarks from DNNs with Limited Data},
author = {Yifan Lu and Wenxuan Li and Mi Zhang and Xudong Pan and Min Yang},
journal= {arXiv preprint arXiv:2309.03466},
year = {2024}
}
备注
20 pages, ver 2.0, accepted by CCS '24