从扩散模型中可复现地提取训练图像
计算机视觉与模式识别
2023-05-16 v1 人工智能
摘要
最近,Carlini 等人证明广泛使用的模型 Stable Diffusion 可反刍真实的训练样本,从版权角度看这是令人困扰的。在本工作中,我们提供了一种与近期攻击效力相当、但网络评估量少几个数量级的高效提取攻击。在此过程中,我们揭示了一种新现象,称之为模板逐字(template verbatims),即扩散模型会在很大程度上完整地反刍训练样本。模板逐字更难检测,因为它们需要检索与掩码才能正确标注。此外,它们仍由 newer 系统生成,即便是那些对其训练集去重过的系统,我们对其在生成中仍出现的原因给出了见解。我们从多个前沿系统中提取了训练图像,包括 Stable Diffusion 2.0、Deep Image Floyd,以及最后的 Midjourney v4。我们发布了用于验证提取攻击、执行攻击以及所有提取提示的代码,见 \url{https://github.com/ryanwebster90/onestep-extraction}。
引用
@article{arxiv.2305.08694,
title = {A Reproducible Extraction of Training Images from Diffusion Models},
author = {Ryan Webster},
journal= {arXiv preprint arXiv:2305.08694},
year = {2023}
}