面向扩散模型的黑盒成员推断攻击
密码学与安全
2025-08-14 v5 人工智能
计算机视觉与模式识别
机器学习
摘要
鉴于 AI 生成艺术日益流行以及相关的版权问题,识别一件艺术品是否被用于训练扩散模型是一个重要的研究课题。本文从成员推断攻击(MIA)的角度来处理这个问题。我们首先确定了将现有 MIA 方法应用于专有扩散模型的局限性:需要访问内部 U-net。为了解决上述问题,我们引入了一种新颖的成员推断攻击方法,该方法仅使用图像到图像的变化 API,并且无需访问模型的内部 U-net 即可运行。我们的方法基于这样的直觉:模型可以更容易地获得训练集中图像的无偏噪声预测估计。通过多次对目标图像应用 API,对输出进行平均,并将结果与原始图像进行比较,我们的方法可以分类一个样本是否是训练集的一部分。我们使用 DDIM 和 Stable Diffusion 设置验证了我们的方法,并进一步将我们的方法和现有算法扩展到 Diffusion Transformer 架构。我们的实验结果始终优于以前的方法。
引用
@article{arxiv.2405.20771,
title = {Towards Black-Box Membership Inference Attack for Diffusion Models},
author = {Jingwei Li and Jing Dong and Tianxing He and Jingzhao Zhang},
journal= {arXiv preprint arXiv:2405.20771},
year = {2025}
}