通过不变神经元变换破解白盒深度神经网络水印
密码学与安全
2022-05-20 v2 计算机视觉与模式识别
机器学习
摘要
近来,如何保护深度神经网络(DNN)的知识产权(IP)成为人工智能产业的主要关切。为应对潜在的模型盗版,近期研究探索了多种水印策略,将秘密身份消息嵌入目标模型的预测行为或内部(例如权重与神经元激活)中。牺牲较少功能性并涉及更多关于目标模型的知识,后一类水印方案(即白盒模型水印)被宣称准确、可信且能抵御大多数已知水印去除攻击,并在产业中出现了新兴研究与应用。在本文中,我们提出首个有效的去除攻击,以可证明无性能开销且无需先验知识的方式破解几乎所有现有白盒水印方案。通过在神经元粒度上分析这些知识产权保护机制,我们首次发现它们共同依赖于局部神经元组的一组脆弱特征,所有这些特征均可被我们提出的不变神经元变换链任意篡改。在 种最先进的白盒水印方案和广泛的产业级 DNN 架构上,我们的攻击首次将受保护模型中嵌入的身份消息降低至近乎随机。同时,不同于已知去除攻击,我们的攻击无需关于训练数据分布或所采用水印算法的先验知识,并保持模型功能完好。
引用
@article{arxiv.2205.00199,
title = {Cracking White-box DNN Watermarks via Invariant Neuron Transforms},
author = {Yifan Yan and Xudong Pan and Yining Wang and Mi Zhang and Min Yang},
journal= {arXiv preprint arXiv:2205.00199},
year = {2022}
}
备注
in submission; a preprint version