中文

BAGM:一种用于操纵文本到图像生成模型的后门攻击

计算机视觉与模式识别 2023-09-06 v2 人工智能 密码学与安全

摘要

文本到图像生成式人工智能(AI)的流行引起了广泛的公众兴趣。我们证明该技术可被攻击以生成对其用户进行微妙操纵的内容。我们提出了一种针对文本到图像生成模型的后门攻击(BAGM),其在触发时会将操纵性细节注入生成图像中,这些细节自然融入内容。我们的攻击首次针对生成过程三个阶段的三种流行文本到图像生成模型,通过修改嵌入式分词器、语言模型或图像生成模型的行为来实现。基于渗透程度,BAGM以一组攻击的形式呈现,本文中称为表面攻击、浅层攻击和深层攻击。鉴于该领域现有空白,我们还贡献了一套专门设计用于评估文本到图像模型后门攻击效果的全面定量指标。BAGM的有效性通过对最先进生成模型的攻击得以确立,以营销场景作为目标领域。为此,我们贡献了一个品牌产品图像数据集。我们嵌入的后门使朝向目标输出的偏置增加到通常的五倍以上,且不损害模型鲁棒性或生成内容效用。通过暴露生成式AI的漏洞,我们鼓励研究者应对这些挑战,实践者在使用的预训练模型时保持谨慎。相关代码、输入提示和补充材料可在 https://github.com/JJ-Vice/BAGM 找到,数据集可在:https://ieee-dataport.org/documents/marketable-foods-mf-dataset 获取。关键词:生成式人工智能,生成模型,文本到图像生成,后门攻击,木马,Stable Diffusion。

关键词

引用

@article{arxiv.2307.16489,
  title  = {BAGM: A Backdoor Attack for Manipulating Text-to-Image Generative Models},
  author = {Jordan Vice and Naveed Akhtar and Richard Hartley and Ajmal Mian},
  journal= {arXiv preprint arXiv:2307.16489},
  year   = {2023}
}

备注

This research was supported by National Intelligence and Security Discovery Research Grants (project# NS220100007), funded by the Department of Defence Australia