中文

面向图像生成模型预训练数据的黑盒成员推断攻击

计算机视觉与模式识别 2026-05-27 v1 人工智能

摘要

扩散式图像生成模型的快速发展引发了关于潜在版权和隐私侵权的严重担忧。成员推断攻击(MIA)已成为识别模型训练期间未授权数据使用情况的有力工具。现有方法通常通过评估模型对去噪扰动可疑图像的能力,以作为成员身份的指示器。然而,这类特征的判别力高度依赖于模型记忆程度,在应用于较少暴露的数据(如预训练数据)时会显著下降。尽管已有若干方法试图通过利用内部模型特征来增强检测,但这些特征通常在主流封闭源图像生成平台中不可获取,限制了其实际应用。本文演示了分析黑盒扩散模型如何去噬目标图像及其对应的扰动文本指令,能够揭示更具辨识力的成员线索。基于此洞见,我们提出了一个黑盒成员推断攻击框架(命名为 SD-MIA),利用跨模态数据扰动机制来检测扩散模型中的预训练数据。我们在公共基准数据集和新构建的数据集上进行了大量实验,每个数据集均包含具有相同分布的预训练成员样本和非成员样本。实验结果表明,SD-MIA 在已知基准中表现出优于现有方法的优势,包括那些虽拥有访问内部模型特征的优势但不公平的基准方法。

关键词

引用

@article{arxiv.2605.27020,
  title  = {Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models},
  author = {Tao Qi and Huili Wang and Yuanhong Huang and Wendan Wang and Lianchao Zhao and Jinrui Wang and Zichen Qin and Shangguang Wang and Yongfeng Huang},
  journal= {arXiv preprint arXiv:2605.27020},
  year   = {2026}
}

备注

13 pages, 9 figures; CVPR 2026 camera-ready