DAWN:神经网络动态对抗水印
密码学与安全
2021-07-19 v5 机器学习
摘要
训练机器学习 (ML) 模型在计算能力、标注数据量以及人类专业知识方面代价高昂。因此,ML 模型对其所有者而言构成知识产权 (IP) 与商业价值。在模型训练过程中嵌入数字水印可使模型所有者在模型遭窃取或滥用时后续识别其模型。然而,模型功能也可通过模型提取被窃取: adversary 利用原模型预测 API 返回的结果训练替代模型。近期工作表明模型提取是一种现实威胁。现有水印方案对于通过模型提取实施的 IP 窃取无效,因为训练替代模型的是 adversary。本文提出 DAWN (Dynamic Adversarial Watermarking of Neural Networks,神经网络动态对抗水印),这是首个利用水印遏制模型提取 IP 窃取的方法。与先前水印方案不同,DAWN 不改变训练过程,而是在受保护模型的预测 API 处运作,通过动态改变来自 API 客户端的少量查询 (例如 <0.5%) 的响应。该查询集即为水印,若客户利用其查询训练替代模型则水印会被嵌入。我们表明 DAWN 对两种最先进的模型提取攻击具有鲁棒性,能有效为所有提取出的替代模型加水印,使模型所有者能以可靠方式证明所有权 (置信度 ),且预测精度损失可忽略 (0.03-0.5%)。
引用
@article{arxiv.1906.00830,
title = {DAWN: Dynamic Adversarial Watermarking of Neural Networks},
author = {Sebastian Szyller and Buse Gul Atli and Samuel Marchal and N. Asokan},
journal= {arXiv preprint arXiv:1906.00830},
year = {2021}
}
备注
Shorter version of this work to appear in Proceedings of the ACM Multimedia 2021; 16 pages, 3 figures