HODA:面向硬度的模型提取攻击检测
机器学习
2022-02-25 v2 密码学与安全
摘要
模型提取攻击利用目标模型的预测 API 创建替代模型,以在黑盒设定下窃取或侦察目标模型的功能。若干近期研究表明,数据受限的对手即便无法或仅有限访问目标模型训练数据分布的样本,也可使用合成或语义相似样本实施模型提取攻击。本文中,我们利用学习难度的概念定义样本的硬度程度。样本的硬度程度取决于该样本预测标签收敛时的 epoch 数。我们研究样本的硬度程度,并证明数据受限对手样本序列的硬度程度直方图区别于良性用户样本序列的硬度程度直方图。我们提出面向硬度的检测方法(HODA)以检测模型提取攻击的样本序列。结果表明,HODA 仅通过监测其中 100 个样本就能以高成功率检测模型提取攻击的样本序列,并且优于所有先前的模型提取检测方法。
引用
@article{arxiv.2106.11424,
title = {HODA: Hardness-Oriented Detection of Model Extraction Attacks},
author = {Amir Mahdi Sadeghzadeh and Amir Mohammad Sobhanian and Faezeh Dehghan and Rasool Jalili},
journal= {arXiv preprint arXiv:2106.11424},
year = {2022}
}
备注
15 pages, 12 figures, 7 tables, 2 Alg