生成对抗网络上的模型提取与防御
密码学与安全
2021-01-07 v1 计算机视觉与模式识别
机器学习
摘要
模型提取攻击旨在通过查询访问目标模型来复制机器学习模型。早期研究主要关注判别模型。尽管取得了成功,针对生成模型的模型提取攻击却较少被探索。在本文中,我们系统地研究了针对生成对抗网络 (GANs) 的模型提取攻击的可行性。具体而言,我们首先定义了针对 GANs 的模型提取攻击的准确率和保真度。然后,根据攻击者的目标和背景知识,我们从准确率提取和保真度提取的角度研究针对 GANs 的模型提取攻击。我们进一步开展了一个案例研究,其中攻击者可以转移所提取模型的知识——该模型窃取了一个用超过 300 万张图像训练的最先进 GAN——到新领域,以拓宽模型提取攻击的应用范围。最后,我们考虑 GAN 模型效用与安全性之间的权衡,提出了有效的防御技术以保护 GANs。
引用
@article{arxiv.2101.02069,
title = {Model Extraction and Defenses on Generative Adversarial Networks},
author = {Hailong Hu and Jun Pang},
journal= {arXiv preprint arXiv:2101.02069},
year = {2021}
}