中文

面向扩散模型的黑盒成员推断攻击

密码学与安全 2025-08-14 v5 人工智能 计算机视觉与模式识别 机器学习

摘要

鉴于 AI 生成艺术日益流行以及相关的版权问题,识别一件艺术品是否被用于训练扩散模型是一个重要的研究课题。本文从成员推断攻击(MIA)的角度来处理这个问题。我们首先确定了将现有 MIA 方法应用于专有扩散模型的局限性:需要访问内部 U-net。为了解决上述问题,我们引入了一种新颖的成员推断攻击方法,该方法仅使用图像到图像的变化 API,并且无需访问模型的内部 U-net 即可运行。我们的方法基于这样的直觉:模型可以更容易地获得训练集中图像的无偏噪声预测估计。通过多次对目标图像应用 API,对输出进行平均,并将结果与原始图像进行比较,我们的方法可以分类一个样本是否是训练集的一部分。我们使用 DDIM 和 Stable Diffusion 设置验证了我们的方法,并进一步将我们的方法和现有算法扩展到 Diffusion Transformer 架构。我们的实验结果始终优于以前的方法。

关键词

引用

@article{arxiv.2405.20771,
  title  = {Towards Black-Box Membership Inference Attack for Diffusion Models},
  author = {Jingwei Li and Jing Dong and Tianxing He and Jingzhao Zhang},
  journal= {arXiv preprint arXiv:2405.20771},
  year   = {2025}
}