中文

静默品牌攻击:文本到图像扩散模型的无触发数据投毒攻击

计算机视觉与模式识别 2025-03-14 v1 人工智能 密码学与安全

摘要

文本到图像扩散模型在从文本提示生成高质量内容方面取得了显著成功。然而,其对公开可用数据的依赖以及用于微调的日益增长的数据共享趋势,使这些模型特别容易受到数据投毒攻击。在本工作中,我们引入了静默品牌攻击(Silent Branding Attack),一种新颖的数据投毒方法,可在无需任何文本触发的情况下操纵文本到图像扩散模型,使其生成包含特定品牌标志或符号的图像。我们发现,当某些视觉模式在训练数据中反复出现时,模型会自然地学会在输出中再现它们,即使没有提示提及。利用这一点,我们开发了一种自动数据投毒算法,将标志不显眼地注入原始图像,确保它们自然融合且不被检测到。使用投毒数据集训练的模型在生成包含标志的图像时不会降低图像质量或文本对齐。我们在两个真实场景——大规模高质量图像数据集和风格个性化数据集——上对静默品牌攻击进行了实验验证,即使没有特定的文本触发,也能取得高成功率。人工评估和包括标志检测在内的定量指标表明,我们的方法可以隐蔽地嵌入标志。

关键词

引用

@article{arxiv.2503.09669,
  title  = {Silent Branding Attack: Trigger-free Data Poisoning Attack on Text-to-Image Diffusion Models},
  author = {Sangwon Jang and June Suk Choi and Jaehyeong Jo and Kimin Lee and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2503.09669},
  year   = {2025}
}

备注

CVPR 2025. Project page: https://silent-branding.github.io/