通过多模态数据投毒可轻易对文本到图像扩散模型植入后门
密码学与安全
2023-10-24 v2 计算机视觉与模式识别
多媒体
摘要
在条件机制的帮助下,最先进的扩散模型在引导式图像生成特别是文本到图像合成中取得了巨大成功。为更好地理解文本到图像合成的训练过程与潜在风险,我们对文本到图像扩散模型的后门攻击进行了系统性研究,并提出 BadT2I,一种在多样语义层级上篡改图像合成的通用多模态后门攻击框架。具体而言,我们在三个视觉语义层级上进行后门攻击:像素后门、对象后门与风格后门。通过利用正则化损失,我们的方法能高效地将后门注入大规模文本到图像扩散模型,同时保持其对良性输入的效用。我们在广泛使用的文本到图像扩散模型 Stable Diffusion 上进行了实证实验,表明大规模扩散模型可在少量微调步内被轻易植入后门。我们进行了额外实验以探究不同类型文本触发器的影响,以及进一步训练期间后门的持续性,为后门防御方法的发展提供见解。此外,我们的研究未来可能有助于文本到图像模型的版权保护。
引用
@article{arxiv.2305.04175,
title = {Text-to-Image Diffusion Models can be Easily Backdoored through Multimodal Data Poisoning},
author = {Shengfang Zhai and Yinpeng Dong and Qingni Shen and Shi Pu and Yuejian Fang and Hang Su},
journal= {arXiv preprint arXiv:2305.04175},
year = {2023}
}
备注
Carmera-ready version. To appear in ACM MM 2023. Code will be released at: https://github.com/sf-zhai/BadT2I