中文

基于状态监测的模型提取攻击检测

机器学习 2021-07-13 v1 人工智能 密码学与安全 机器学习

摘要

机器学习即服务(Machine-Learning-as-a-Service)提供商通过应用程序编程接口(API)向开发者开放机器学习(ML)模型。近期研究表明,攻击者可通过自主选择样本查询这些 API,从而提取出此类 ML 模型的良好近似。我们提出 VarDetect,一种状态化监视器,用于跟踪该服务用户所发起查询的分布,以检测模型提取攻击。借助改进变分自编码器学习到的潜变量分布,VarDetect 能将三类攻击样本与良性样本稳健区分,并对每一类成功发出警报。此外,在将 VarDetect 部署为自动化防御机制后,所提取的替代模型如预期般表现出较差的性能与可迁移性。最后,我们证明即便具备 VarDetect 部署先验知识的自适应攻击者,也会被其检测到。

关键词

引用

@article{arxiv.2107.05166,
  title  = {Stateful Detection of Model Extraction Attacks},
  author = {Soham Pal and Yash Gupta and Aditya Kanade and Shirish Shevade},
  journal= {arXiv preprint arXiv:2107.05166},
  year   = {2021}
}