基于通用对抗扰动对深度神经网络进行全局指纹标识
密码学与安全
2022-05-10 v3 人工智能
摘要
在本文中,我们提出了一种新颖且实用的机制,使服务提供者能够验证可疑模型是否通过模型提取攻击从受害模型窃取而来。我们的核心见解是,DNN模型决策边界的轮廓可由其通用对抗扰动(Universal Adversarial Perturbations, UAPs)唯一刻画。UAPs属于低维子空间,且盗版模型的子空间相较于非盗版模型与受害模型的子空间更为一致。基于此,我们提出了一种针对DNN模型的UAP指纹方法,并通过对比学习训练了一个以指纹为输入、输出相似度分数的编码器。大量研究表明,我们的框架仅需可疑模型的20个指纹即可以超过99.99%的置信度检测模型知识产权侵犯。该方法在不同模型架构间具有良好的泛化性,并且对窃取模型上的后续修改具有鲁棒性。
引用
@article{arxiv.2202.08602,
title = {Fingerprinting Deep Neural Networks Globally via Universal Adversarial Perturbations},
author = {Zirui Peng and Shaofeng Li and Guoxing Chen and Cheng Zhang and Haojin Zhu and Minhui Xue},
journal= {arXiv preprint arXiv:2202.08602},
year = {2022}
}
备注
Accepted to CVPR 2022 (Oral Presentation)