中文

扩散模型的引人注目特性:文本到图像生成模型中自然攻击能力的实证研究

计算机视觉与模式识别 2024-05-03 v2 密码学与安全

摘要

去噪概率扩散模型已展现出比 GAN 等先前模型更具突破性的性能,可生成更逼真照片级图像或人类水平插画。这种高图像生成能力刺激了多个领域许多下游应用的产生。然而,我们发现该技术实为一把双刃剑:我们基于如下发现识别出一种新型攻击,称为自然去噪扩散(NDD)攻击——最先进的深度神经网络(DNN)模型即便我们通过文本提示有意移除对人类视觉系统(HVS)至关重要的鲁棒特征,仍保持其预测。NDD 攻击通过利用扩散模型中的自然攻击能力,展现出生成低成本、模型无关且可迁移对抗攻击的显著高水平能力。为系统评估 NDD 攻击风险,我们使用新创建的数据集——自然去噪扩散攻击(NDDA)数据集进行了大规模实证研究。我们通过回答 6 个研究问题来评估自然攻击能力。通过用户研究,我们发现其能以 88% 检测率实现攻击,同时对 93% 的人类受试者隐蔽;我们还发现扩散模型嵌入的非鲁棒特征促成了自然攻击能力。为确认模型无关与可迁移攻击能力,我们对特斯拉 Model 3 实施 NDD 攻击,发现 73% 的物理打印攻击可被检测为停车标志。我们希望该研究与数据集能帮助社区意识到扩散模型中的风险,并促进面向鲁棒 DNN 模型的进一步研究。

关键词

引用

@article{arxiv.2308.15692,
  title  = {Intriguing Properties of Diffusion Models: An Empirical Study of the Natural Attack Capability in Text-to-Image Generative Models},
  author = {Takami Sato and Justin Yue and Nanze Chen and Ningfei Wang and Qi Alfred Chen},
  journal= {arXiv preprint arXiv:2308.15692},
  year   = {2024}
}