基于知识迁移的仅标签模型反演攻击
机器学习
2023-10-31 v1 密码学与安全
计算机视觉与模式识别
摘要
在模型反演(MI)攻击中,攻击者滥用对机器学习(ML)模型的访问权限来推断并重建私有训练数据。在白盒和黑盒设定下已取得显著进展,其中攻击者分别可访问完整模型或模型的软输出。然而,在最具挑战性但实际应用中最重要的设定下研究非常有限:仅标签 MI 攻击,攻击者仅能访问模型预测的标签(硬标签),没有置信度分数,也没有任何其他模型信息。本文提出 LOKT,一种用于仅标签 MI 攻击的新方法。我们的思路基于将知识从不透明的目标模型迁移到替代模型。随后,利用这些替代模型,我们的方法能够借助先进的白盒攻击。我们提出基于生成建模的知识迁移,并引入一个新模型——目标模型辅助 ACGAN(T-ACGAN),以实现有效的知识迁移。我们的方法将极具挑战性的仅标签 MI 转化为更易处理的白盒设定。我们提供分析以支撑:基于本方法的替代模型可作为目标模型在 MI 中的有效代理。实验表明,我们的方法在所有 MI 基准上比现有 SOTA 仅标签 MI 攻击显著高出 15% 以上。此外,我们的方法在查询预算方面也具优势。我们的研究凸显了即便仅暴露最少信息(即硬标签)时,ML 模型面临的不断上升的隐私威胁。我们的研究凸显了即便仅暴露最少信息(即硬标签)时,ML 模型面临的不断上升的隐私威胁。我们的代码、演示、模型和重建数据可在项目页获取:https://ngoc-nguyen-0.github.io/lokt/
引用
@article{arxiv.2310.19342,
title = {Label-Only Model Inversion Attacks via Knowledge Transfer},
author = {Ngoc-Bao Nguyen and Keshigeyan Chandrasegaran and Milad Abdollahzadeh and Ngai-Man Cheung},
journal= {arXiv preprint arXiv:2310.19342},
year = {2023}
}
备注
Accepted to Neurips 2023. The first two authors contributed equally