FDINet:基于特征失真指数的DNN模型提取防护
密码学与安全
2024-10-23 v3 机器学习
摘要
机器学习即服务(MLaaS)平台因其可及性、成本效益、可扩展性与快速开发能力而日益流行。然而,近期研究揭示了MLaaS中基于云的模型易遭受模型提取攻击的脆弱性。本文引入FDINET,一种利用深度神经网络(DNN)模型特征分布的新型防御机制。具体而言,通过分析攻击者查询的特征分布,我们发现这些查询的特征分布偏离了模型训练集的分布。基于这一关键观察,我们提出特征失真指数(FDI),一种用于定量度量接收查询特征分布偏离程度的指标。所提FDINET利用FDI训练一个二分类检测器,并借助FDI相似度从分布式提取攻击中识别共谋攻击者。我们在四个基准数据集与四种流行模型架构上,针对六种最先进的提取攻击对FDINET进行了充分实验评估。实证结果显示如下发现:FDINET在检测模型提取上极为有效,在DFME与DaST上达到100%检测准确率;FDINET高效,仅用50条查询即可对GTSRB发出提取告警,平均置信度96.08%;FDINET能以超过91%的准确率识别共谋攻击者,并展现出检测两类自适应攻击的能力。
引用
@article{arxiv.2306.11338,
title = {FDINet: Protecting against DNN Model Extraction via Feature Distortion Index},
author = {Hongwei Yao and Zheng Li and Haiqin Weng and Feng Xue and Zhan Qin and Kui Ren},
journal= {arXiv preprint arXiv:2306.11338},
year = {2024}
}
备注
Accepted to IEEE Transactions on Dependable and Secure Computing