针对扩散模型的白盒成员推断攻击
密码学与安全
2025-07-08 v3
摘要
由于其卓越的图像生成性能,扩散模型在工业应用中已开始超越 GAN 及其他生成模型。这些模型的复杂架构提供了丰富的攻击特征。有鉴于此,我们旨在设计针对扩散模型的成员推断攻击(MIAs)。我们首先对现有扩散模型上的 MIA 进行详尽分析,考量黑盒/白盒模型及攻击特征选择等因素。我们发现白盒攻击在现实场景中高度适用,且当前最有效的攻击为白盒攻击。不同于以往研究采用模型损失作为白盒 MIA 的攻击特征,我们利用模型梯度进行攻击,凭借梯度能更深入刻画模型对不同样本的响应。我们在训练步数、采样频率、扩散步数与数据方差等一系列参数下对这些模型进行严格测试。在所有实验设定中,我们的方法始终展现出近乎完美的攻击性能,攻击成功率接近 100%,攻击 AUCROC 接近 1.0。我们还针对常见防御机制评估了攻击,观察到攻击仍保持良好性能。
引用
@article{arxiv.2308.06405,
title = {White-box Membership Inference Attacks against Diffusion Models},
author = {Yan Pang and Tianhao Wang and Xuhui Kang and Mengdi Huai and Yang Zhang},
journal= {arXiv preprint arXiv:2308.06405},
year = {2025}
}