中文

Nightshade:面向文本到图像生成模型的提示特定投毒攻击

密码学与安全 2024-04-30 v3 人工智能

摘要

数据投毒攻击通过操纵训练数据,在训练时向机器学习模型引入预期之外的行为。对于拥有海量训练数据集的文本到图像生成模型,当前对投毒攻击的认识认为,一次成功的攻击需要向其训练流程中注入数百万个毒样本。在本文中,我们表明投毒攻击可在生成模型上成功实施。我们观察到这些模型中每个概念的训练数据可能相当有限,使其易受提示特定投毒攻击——该类攻击针对模型对单个提示作出响应的能力。我们提出 Nightshade,一种优化的提示特定投毒攻击,其中毒样本在视觉上与带有匹配文本提示的良性图像完全一致。Nightshade 毒样本还针对效能进行了优化,可在 <100 个毒样本内破坏 Stable Diffusion SDXL 的一个提示。Nightshade 的毒效会“渗透”至相关概念,且多次攻击可在单个提示中组合。令人惊讶的是,我们表明中等数量的 Nightshade 攻击可破坏文本到图像生成模型中的通用特征,有效禁用其生成有意义图像的能力。最后,我们提议将 Nightshade 及类似工具作为内容创作者对无视 opt-out/do-not-crawl 指令的网络爬虫的最后一重防御,并讨论对模型训练者与内容创作者的可能影响。

关键词

引用

@article{arxiv.2310.13828,
  title  = {Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models},
  author = {Shawn Shan and Wenxin Ding and Josephine Passananti and Stanley Wu and Haitao Zheng and Ben Y. Zhao},
  journal= {arXiv preprint arXiv:2310.13828},
  year   = {2024}
}

备注

IEEE Security and Privacy 2024