SIDE:从扩散模型中抽取 Surrogate 条件数据
机器学习
2025-08-04 v7 密码学与安全
计算机视觉与模式识别
摘要
随着扩散概率模型 (DPM) 成为生成式 AI (GenAI) 的核心,理解其记忆行为对于评估数据泄露、版权侵权和可信度等风险至关重要。虽然先前的研究发现,条件 DPM 高度易受使用显式提示的資料抽取攻擊,但无条件模型常被假设为安全。我们挑战这一观点,通过引入 Surrogate conditional Data Extraction (SIDE),一种通用框架,用于构建数据驱动的 surrogate 条件,从而实现对任何 DPM 的有针对性抽取。通过在 CIFAR-10、CelebA、ImageNet 和 LAION-5B 上的大量实验,我们展示 SIDE 能够成功从所谓安全的无条件模型中提取训练数据,甚至在条件模型上也超越基线攻击。补充这些发现,我们提出了基于信息标签的统一理论框架,表明所有形式的条件,显式或 surrogate,都放大了记忆。我们的工作重新定义了 DPM 的威胁模型,确立了精确条件作为根本性漏洞,为模型隐私评估设定了更强的基准。
关键词
引用
@article{arxiv.2410.02467,
title = {SIDE: Surrogate Conditional Data Extraction from Diffusion Models},
author = {Yunhao Chen and Shujie Wang and Difan Zou and Xingjun Ma},
journal= {arXiv preprint arXiv:2410.02467},
year = {2025}
}