基于状态监测的模型提取攻击检测
机器学习
2021-07-13 v1 人工智能
密码学与安全
机器学习
摘要
机器学习即服务(Machine-Learning-as-a-Service)提供商通过应用程序编程接口(API)向开发者开放机器学习(ML)模型。近期研究表明,攻击者可通过自主选择样本查询这些 API,从而提取出此类 ML 模型的良好近似。我们提出 VarDetect,一种状态化监视器,用于跟踪该服务用户所发起查询的分布,以检测模型提取攻击。借助改进变分自编码器学习到的潜变量分布,VarDetect 能将三类攻击样本与良性样本稳健区分,并对每一类成功发出警报。此外,在将 VarDetect 部署为自动化防御机制后,所提取的替代模型如预期般表现出较差的性能与可迁移性。最后,我们证明即便具备 VarDetect 部署先验知识的自适应攻击者,也会被其检测到。
引用
@article{arxiv.2107.05166,
title = {Stateful Detection of Model Extraction Attacks},
author = {Soham Pal and Yash Gupta and Aditya Kanade and Shirish Shevade},
journal= {arXiv preprint arXiv:2107.05166},
year = {2021}
}