窃贼,当心使你得手之物:迈向理解模型抽取攻击
机器学习
2021-04-14 v1 密码学与安全
计算机视觉与模式识别
摘要
模型抽取日益吸引研究关注,因为保持商业 AI 模型私有可保留竞争优势。在某些场景中,AI 模型以专有方式训练,既无公开预训练模型,也无充足的同分布数据可用。针对这些模型的模型抽取攻击通常更具破坏性。因此,本文中我们实证研究了此类场景下的模型抽取行为。我们发现现有技术的有效性受预训练模型缺失的显著影响。此外,攻击者的超参数(如模型架构与优化器)以及从查询中检索信息的效用的影响违反直觉。我们提供了一些解释这些现象可能成因的见解。基于这些观察,我们将模型抽取攻击形式化为一个自适应框架,利用深度强化学习刻画这些因素。实验表明,所提框架可用于改进现有技术,并表明在此严格场景下模型抽取仍有可能。我们的研究可帮助系统设计者基于其场景构建更好的防御策略。
引用
@article{arxiv.2104.05921,
title = {Thief, Beware of What Get You There: Towards Understanding Model Extraction Attack},
author = {Xinyi Zhang and Chengfang Fang and Jie Shi},
journal= {arXiv preprint arXiv:2104.05921},
year = {2021}
}
备注
8 pages, 1 figure