基于帐户感知分布差异的模型窃取防御
密码学与安全
2025-03-18 v1 人工智能
摘要
恶意用户通过使用查询响应来训练克隆模型,从而以低成本功能性地复制商业模型,这是一种具有挑战性的任务,需要及时防止此类模型窃取攻击以实现强大的保护并维持实用性。在本文中,我们提出了一种新型非参数检测器,称为帐户感知分布差异(ADD),通过利用帐户级局部依赖性来识别来自恶意用户的查询。我们将每个类别建模为特征空间中的多变量正态分布(MVN),并将恶意得分衡量为加权类别分布差异的总和。ADD检测器与基于随机的预测投毒结合,可产生一个即插即用的防御模块,称为D-ADD,用于图像分类模型。大量实验结果表明,D-ADD在软标签和硬标签设置下均能对不同类型的攻击实现强大的防御,且对服务恶意用户几乎没有干扰。
引用
@article{arxiv.2503.12497,
title = {Defense Against Model Stealing Based on Account-Aware Distribution Discrepancy},
author = {Jian-Ping Mei and Weibin Zhang and Jie Chen and Xuyun Zhang and Tiantian Zhu},
journal= {arXiv preprint arXiv:2503.12497},
year = {2025}
}
备注
11 pages, 7 figures, published in AAAI 2025