中文

PRADA:防御DNN模型窃取攻击

密码学与安全 2019-04-02 v5

摘要

机器学习(ML)应用日益普遍。保护 ML 模型的机密性至关重要,原因有二:(a) 模型可为其所有者带来商业优势;(b) adversary 可能利用窃取的模型寻找可规避原始模型分类的可迁移对抗样本。对模型的访问可限制为仅通过定义良好的预测 API 进行。然而,预测 API 仍提供足够信息,使 adversary 能够通过预测 API 发送重复查询来发起模型提取攻击。在本文中,我们描述了使用生成合成查询和优化训练超参数的新方法来发起新型模型提取攻击。我们的攻击在两类数据集上,就目标与非目标对抗样本的可迁移性(最高 +29-44 个百分点,pp)和预测准确率(最高 +46 pp)而言,优于最先进的模型提取。我们给出了关于如何执行有效模型提取攻击的要点。随后我们提出 PRADA,迈向通用且有效的 DNN 模型提取攻击检测的第一步。它分析连续 API 查询的分布,并在该分布偏离良性行为时发出警报。我们表明 PRADA 可以检测所有先前的模型提取攻击且无假阳性。

关键词

引用

@article{arxiv.1805.02628,
  title  = {PRADA: Protecting against DNN Model Stealing Attacks},
  author = {Mika Juuti and Sebastian Szyller and Samuel Marchal and N. Asokan},
  journal= {arXiv preprint arXiv:1805.02628},
  year   = {2019}
}

备注

17 pages, 7 figures, 9 tables. Accepted for publication in the 4th IEEE European Symposium on Security and Privacy (EuroS&P 2019)