中文

戏弄艺术家:向文本到图像合成中的文本编码器注入后门

机器学习 2023-08-10 v3 人工智能 密码学与安全 计算机视觉与模式识别

摘要

尽管文本到图像合成目前在研究人员和公众中广受欢迎,但这些模型的安全性迄今被忽视。许多文本引导的图像生成模型依赖来自外部资源的预训练文本编码器,其用户相信所获取的模型会如承诺般表现。不幸的是,情况未必如此。我们引入针对文本引导生成模型的后门攻击,并证明它们的文本编码器构成了重大的篡改风险。我们的攻击仅轻微改动一个编码器,使得在干净提示下生成图像时无明显可疑模型行为。随后通过在提示中插入单个字符触发器(例如非拉丁字符或表情符号), adversary可触发模型生成具有预定义属性的图像,或遵循隐藏的、潜在恶意描述的图像。我们在Stable Diffusion上实证展示了攻击的高有效性,并强调单个后门的注入过程耗时不到两分钟。除了将我们的方法仅表述为攻击外,它也可强制编码器遗忘与某些概念(如裸露或暴力)相关的短语,并有助于使图像生成更安全。

关键词

引用

@article{arxiv.2211.02408,
  title  = {Rickrolling the Artist: Injecting Backdoors into Text Encoders for Text-to-Image Synthesis},
  author = {Lukas Struppek and Dominik Hintersdorf and Kristian Kersting},
  journal= {arXiv preprint arXiv:2211.02408},
  year   = {2023}
}

备注

Published as a conference paper at ICCV 2023