RADEP:抵御模型提取攻击的弹性自适应防御框架
密码学与安全
2025-05-27 v1
摘要
机器学习即服务通过基于云的 API 使用户能够利用强大的机器学习模型,提供了可扩展性和易于部署的优势。然而,这些服务容易受到模型提取攻击,攻击者通过反复查询应用程序编程接口 (API) 来重构功能相似的模型,从而危及知识产权和安全性。尽管已有多种防御策略被提出,但许多策略存在计算成本高、对不断演变的攻击技术适应性有限,以及降低合法用户性能的问题。在本文中,我们提出了一种用于模型提取攻击保护的弹性自适应防御框架 (RADEP),这是一种多层面的防御框架,旨在通过多层安全方法对抗模型提取攻击。RADEP 采用渐进式对抗训练来增强模型抵御提取尝试的弹性。恶意查询检测通过不确定性量化和行为模式分析相结合来实现,从而有效识别对抗性查询。此外,我们开发了一种自适应响应机制,根据查询的可疑评分动态修改查询输出,降低被盗模型的效用。最后,通过嵌入水印和后门触发器来实施所有权验证,从而可靠地识别未经授权的模型使用。实验评估表明,RADEP 显著降低了提取成功率,同时保持了高检测准确率,且对合法查询的影响极小。大量实验表明,RADEP 能有效抵御模型提取攻击,甚至面对自适应攻击者也能保持弹性,使其成为 MLaaS 模型的可靠安全框架。
引用
@article{arxiv.2505.19364,
title = {RADEP: A Resilient Adaptive Defense Framework Against Model Extraction Attacks},
author = {Amit Chakraborty and Sayyed Farid Ahamed and Sandip Roy and Soumya Banerjee and Kevin Choi and Abdul Rahman and Alison Hu and Edward Bowen and Sachin Shetty},
journal= {arXiv preprint arXiv:2505.19364},
year = {2025}
}
备注
Presented at the IEEE International Wireless Communications and Mobile Computing Conference (IWCMC) 2025