MEGEX:针对基于梯度的可解释 AI 的无数据模型提取攻击
密码学与安全
2021-07-20 v1 机器学习
摘要
可解释人工智能的进展为其预测提供理由,有望加速深度神经网络在现实世界中的使用,例如机器学习即服务 (MLaaS) 利用训练好的模型对查询数据返回预测。部署于 MLaaS 中的深度神经网络面临模型提取攻击的威胁。模型提取攻击是一种侵犯知识产权与隐私的攻击,其中 adversary 仅利用其预测在云中窃取训练好的模型。特别是,近期提出了一种无数据模型提取攻击,其更为关键。在该攻击中,adversary 使用生成模型而非准备输入数据。然而,该攻击的可行性尚需研究,因其比使用替代数据集的攻击需要更多查询。本文中,我们提出 MEGEX,一种针对基于梯度的可解释 AI 的无数据模型提取攻击。在该方法中,adversary 利用解释来训练生成模型,并减少窃取模型所需的查询数量。我们的实验表明,所提方法重构了高精度模型——在 SVHN 与 CIFAR-10 数据集上分别给定 2M 与 20M 次查询,达到受害模型精度的 0.97 与 0.98。这意味着模型的可解释性与其被窃取的难度之间存在权衡。
引用
@article{arxiv.2107.08909,
title = {MEGEX: Data-Free Model Extraction Attack against Gradient-Based Explainable AI},
author = {Takayuki Miura and Satoshi Hasegawa and Toshiki Shibahara},
journal= {arXiv preprint arXiv:2107.08909},
year = {2021}
}
备注
10 pages, 5 figures