T2IShield:防御文本到图像扩散模型中的后门攻击
计算机视觉与模式识别
2024-07-18 v2
摘要
虽然文本到图像扩散模型在生成方面表现出惊人的能力,但它们也暴露于后门攻击的脆弱性,这类攻击通过恶意触发器来操纵模型输出。在本文中,我们首次提出一种综合防御方法T2IShield,用于检测、定位并缓解此类攻击。具体而言,我们发现后门触发器在交叉注意力图上导致“同化现象”。基于此关键发现,我们提出了两种有效的后门检测方法:弗罗benius范数阈值截断和协方差判别分析。此外,我们引入二分查找方法来定位后门样本中的触发器,并评估现有概念编辑方法在缓解后门攻击方面的效果。在两个先进的后门攻击场景中进行的实证评估表明,我们提出的防御方法有效。对于后门样本检测,T2IShield以88.9%的检测F1分数实现,同时具有较低的计算成本。此外,T2IShield实现了86.4%的定位F1分数,并无效化了99%的受毒化样本。代码已在https://github.com/Robin-WZQ/T2IShield上发布。
引用
@article{arxiv.2407.04215,
title = {T2IShield: Defending Against Backdoors on Text-to-Image Diffusion Models},
author = {Zhongqi Wang and Jie Zhang and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2407.04215},
year = {2024}
}
备注
Accepted by ECCV2024