中文

评估文本到图像扩散模型对真实世界攻击的鲁棒性

密码学与安全 2023-06-26 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

文本到图像(T2I)扩散模型(DMs)在根据文本描述生成高质量图像方面已展现出潜力。这些模型的实际应用需要特别关注其安全性与保真度,但这一点尚未得到充分探索。一个基本问题是:现有的 T2I DMs 是否对输入文本的变化具有鲁棒性。为回答该问题,本工作首次针对真实世界攻击对 T2I DMs 进行鲁棒性评估。与以往聚焦于通过对输入文本进行虚构篡改来实施恶意攻击的研究不同,我们考虑由人类可能犯的现实错误(如拼写错误、字形错误、语音错误)所构成的攻击空间,以确保语义一致性。鉴于生成过程固有的随机性,我们提出了基于分布的新颖攻击目标来误导 T2I DMs。我们以黑盒方式实施攻击,无需任何模型知识。大量实验证明了我们的方法在攻击流行 T2I DMs 方面的有效性,同时也揭示了它们不容忽视的鲁棒性问题。此外,我们对方法进行了深入分析,表明其并非仅旨在攻击 T2I DMs 中的文本编码器。

关键词

引用

@article{arxiv.2306.13103,
  title  = {Evaluating the Robustness of Text-to-image Diffusion Models against Real-world Attacks},
  author = {Hongcheng Gao and Hao Zhang and Yinpeng Dong and Zhijie Deng},
  journal= {arXiv preprint arXiv:2306.13103},
  year   = {2023}
}