MISLEADER:利用蒸馏模型集成防御模型提取攻击
密码学与安全
2025-06-04 v1 人工智能
摘要
模型提取攻击旨在通过查询访问复制黑盒模型的功能,威胁着机器学习即服务提供商的知识产权。防御此类攻击极具挑战性,因为在真实场景中必须平衡效率、鲁棒性和效用保持。尽管近期取得了进展,但大多数现有防御方法假设攻击者查询包含分布外样本,从而能够检测并破坏可疑输入。然而,这一假设正变得越来越不可靠,因为现代模型在多样化数据集上训练,且攻击者通常在有限的查询预算下操作。因此,这些防御方法在现实部署场景中的有效性受到显著损害。为了解决这一差距,我们提出了 MISLEADER(enseMbles of dIStiLled modEls Against moDel ExtRaction),一种不依赖 OOD 假设的新型防御策略。MISLEADER 将模型保护表述为一个双层优化问题,在保持对良性输入预测保真度的同时,降低潜在克隆模型的可提取性。我们的框架结合了用于模拟攻击者查询的数据增强与异构蒸馏模型集成,以提高鲁棒性和多样性。我们进一步提供了易于处理的近似算法,并推导了理论误差界限以表征防御有效性。在各种设置下的广泛实验验证了我们提出的防御策略的效用保持和抗提取特性。代码可在 https://github.com/LabRAI/MISLEADER 获取。
引用
@article{arxiv.2506.02362,
title = {MISLEADER: Defending against Model Extraction with Ensembles of Distilled Models},
author = {Xueqi Cheng and Minxing Zheng and Shixiang Zhu and Yushun Dong},
journal= {arXiv preprint arXiv:2506.02362},
year = {2025}
}