基于可转移对抗样本的深层神经网络指纹识别
机器学习
2021-01-21 v4 密码学与安全
机器学习
摘要
在机器学习即服务中,提供方训练一个深层神经网络并允许许多用户访问。所托管的(源)模型易受模型窃取攻击,即 adversary 通过 API 访问源模型推导出替代模型。对于此类攻击的事后检测,提供方需要一种鲁棒的方法来判断某个可疑模型是否为其模型的替代模型。我们提出了一种针对深层神经网络分类器的指纹识别方法,该方法从源模型提取一组输入,使得仅有替代模型在这些输入的分类上与源模型一致。这些输入是可转移对抗样本的一个子类,我们称之为可转移对抗样本(conferrable adversarial examples),它们以目标标签专门地从源模型转移到其替代模型。我们提出了一种生成这些可转移对抗样本的新方法。我们针对微调、权重剪枝、重训练、不同架构的重训练、相关工作中的三种模型提取攻击、迁移学习、对抗训练以及两种新的自适应攻击,广泛研究了我们指纹的不可移除性。我们的指纹对蒸馏、相关模型提取攻击甚至当攻击方无法访问模型提供方数据集时的迁移学习都是鲁棒的。我们的指纹是首个在验证替代模型上达到 ROC AUC 为 1.0 的方法,而先前指纹的 ROC AUC 为 0.63。
引用
@article{arxiv.1912.00888,
title = {Deep Neural Network Fingerprinting by Conferrable Adversarial Examples},
author = {Nils Lukas and Yuxuan Zhang and Florian Kerschbaum},
journal= {arXiv preprint arXiv:1912.00888},
year = {2021}
}