QUEEN:针对模型提取的查询忘却
密码学与安全
2024-07-02 v1 人工智能
摘要
模型提取攻击目前构成对深度学习模型安全性和隐私性的非可忽略威胁。通过用小数据集对模型进行查询并将查询结果用作ground-truth标签,攻击者可以窃取一个性能相当于原始模型的盗版模型。导致该威胁的两个关键问题是:一方面,攻击者可以获得准确且不受限制的查询;另一方面,攻击者可以聚合查询结果逐步训练模型。现有的防御方法通常采用模型水印或指纹来保护所有权。然而,这些方法无法主动防止违规行为的发生。为缓解该威胁,我们提出QUEEN (QUEry unlEarNing),主动从一开始就针对潜在的模型提取攻击发起反击。为限制潜在威胁,QUEEN具有灵敏度测量功能,并输出扰动,防止攻击者获得高性能的盗版模型。QUEEN通过测量查询在特征空间中相对于其簇中心的距离来衡量单个查询的灵敏度。为降低攻击的学习准确度,对于高度灵敏的查询批次,QUEEN应用查询忘却,该方法通过梯度反转来扰动softmax输出,以至于盗版模型会生成反向梯度来恶化其性能。实验表明,QUEEN在对抗各种模型提取攻击方面优于最先进的防御方法,且对模型准确度的影响相对较小。该工具包已公开于https://anonymous.4open.science/r/queen implementation-5408/。
引用
@article{arxiv.2407.01251,
title = {QUEEN: Query Unlearning against Model Extraction},
author = {Huajie Chen and Tianqing Zhu and Lefeng Zhang and Bo Liu and Derui Wang and Wanlei Zhou and Minhui Xue},
journal= {arXiv preprint arXiv:2407.01251},
year = {2024}
}