中文

基于帐户感知分布差异的模型窃取防御

密码学与安全 2025-03-18 v1 人工智能

摘要

恶意用户通过使用查询响应来训练克隆模型,从而以低成本功能性地复制商业模型,这是一种具有挑战性的任务,需要及时防止此类模型窃取攻击以实现强大的保护并维持实用性。在本文中,我们提出了一种新型非参数检测器,称为帐户感知分布差异(ADD),通过利用帐户级局部依赖性来识别来自恶意用户的查询。我们将每个类别建模为特征空间中的多变量正态分布(MVN),并将恶意得分衡量为加权类别分布差异的总和。ADD检测器与基于随机的预测投毒结合,可产生一个即插即用的防御模块,称为D-ADD,用于图像分类模型。大量实验结果表明,D-ADD在软标签和硬标签设置下均能对不同类型的攻击实现强大的防御,且对服务恶意用户几乎没有干扰。

关键词

引用

@article{arxiv.2503.12497,
  title  = {Defense Against Model Stealing Based on Account-Aware Distribution Discrepancy},
  author = {Jian-Ping Mei and Weibin Zhang and Jie Chen and Xuyun Zhang and Tiantian Zhu},
  journal= {arXiv preprint arXiv:2503.12497},
  year   = {2025}
}

备注

11 pages, 7 figures, published in AAAI 2025