不可阻挡的攻击:基于条件扩散模型的仅标签模型反演
人工智能
2024-03-07 v3
摘要
模型反演攻击(MIAs)旨在从深度学习模型不可访问的训练集中恢复私有数据,构成了隐私威胁。MIAs 主要关注白盒场景,即攻击者完全访问模型的结构与参数。然而,实际应用通常处于黑盒场景或仅标签场景,即攻击者仅能通过访问模型获得输出置信度向量或标签。因此,现有 MIA 中的攻击模型难以利用目标模型的知识进行有效训练,导致次优攻击。据我们所知,我们开创了仅标签场景下一种强大且实用攻击模型的研究。本文中,我们开发了一种新颖的 MIA 方法,利用条件扩散模型(CDM)从训练集中恢复目标标签下的代表性样本。引入了两项技术:选取与目标模型任务相关的辅助数据集并使用预测标签作为条件引导 CDM 训练;以及将目标标签、预定义引导强度与随机噪声输入训练好的攻击模型以生成并修正多个结果用于最终筛选。该方法使用 Learned Perceptual Image Patch Similarity 作为一种新度量,并作为决定超参数取值的判断依据。实验结果表明,该方法能生成与目标标签相似且准确的样本,优于先前方法的生成器。
引用
@article{arxiv.2307.08424,
title = {Unstoppable Attack: Label-Only Model Inversion via Conditional Diffusion Model},
author = {Rongke Liu and Dong Wang and Yizhi Ren and Zhen Wang and Kaitian Guo and Qianqian Qin and Xiaolei Liu},
journal= {arXiv preprint arXiv:2307.08424},
year = {2024}
}
备注
16 pages, 9 figures, 8 tables