针对定制化文本到图像模型的组合式后门攻击
密码学与安全
2025-09-24 v3
摘要
近年来,文本到图像(Text-to-Image, T2I)合成技术取得了巨大进展。大量具有代表性的 T2I 模型相继涌现,并取得了令人瞩目的应用成果,如 DALL-E、Stable Diffusion、Imagen 等。在实践中,模型开发者越来越倾向于从第三方平台选择性地采用个性化的预训练文本编码器和条件扩散模型,并将它们整合在一起以构建定制化(个性化)的 T2I 模型。然而,这种采用方式容易受到后门攻击。在这项工作中,针对这一应用场景,我们提出了一种针对定制化 T2I 模型的组合式后门攻击(Combinational Backdoor Attack against Customized T2I models, CBACT2I)。与以往针对 T2I 模型的后门攻击不同,CBACT2I 将后门分别嵌入文本编码器和条件扩散模型中。仅当后门文本编码器与后门条件扩散模型组合使用时,定制化 T2I 模型才会表现出后门行为。这些特性使得 CBACT2I 比先前的针对 T2I 模型的后门攻击更具隐蔽性和可控性。大量实验表明,CBACT2I 在不同的后门触发器和后门目标下具有高效性,在不同的定制化文本编码器和扩散模型组合上具有强泛化性,并且在面对最先进的后门检测方法时具有高隐蔽性。
引用
@article{arxiv.2411.12389,
title = {Combinational Backdoor Attack against Customized Text-to-Image Models},
author = {Wenbo Jiang and Jiaming He and Hongwei Li and Rui Zhang and Hanxiao Chen and Meng Hao and Haomiao Yang and Qingchuan Zhao and Guowen Xu},
journal= {arXiv preprint arXiv:2411.12389},
year = {2025}
}