中文

PINCH:一种面向深度学习模型的对抗提取攻击框架

密码学与安全 2023-02-01 v2 人工智能 机器学习

摘要

对抗提取攻击构成对深度学习(DL)模型的一种隐蔽威胁,其中 adversary 旨在窃取目标 DL 模型的架构、参数和超参数。现有提取攻击文献对不同 DL 模型和数据集观察到了不同程度的攻击成功,但其易受攻击背后的根本原因往往不清楚,而这有助于促进构建安全的 DL 系统。在本文中,我们提出 PINCH:一个能够跨异构硬件平台设计、部署和分析提取攻击场景的高效自动化提取攻击框架。利用 PINCH,我们对 21 种模型架构进行了广泛的提取攻击实验评估,以探索新的提取攻击场景并进一步进行攻击 staging。我们的发现表明:(1)关键的提取特征,即特定模型配置对特定攻击表现出强韧性;(2)即便部分提取成功也能为其他对抗攻击启用进一步的 staging;(3)等效的被盗模型揭示了表达能力的差异,却展现出相似的捕获知识。

关键词

引用

@article{arxiv.2209.06300,
  title  = {PINCH: An Adversarial Extraction Attack Framework for Deep Learning Models},
  author = {William Hackett and Stefan Trawicki and Zhengxin Yu and Neeraj Suri and Peter Garraghan},
  journal= {arXiv preprint arXiv:2209.06300},
  year   = {2023}
}

备注

19 pages, 13 figures, 5 tables