将偏见($B^2$)植入稳定扩散模型中
机器学习
2025-07-08 v4 人工智能
密码学与安全
摘要
近期大型文本条件扩散模型的进展彻底改变了图像生成方式,使用户能够从文本提示中创建逼真、高质量的图像,显著提升了艺术创作和视觉传播。然而,这些进展也引入了一种尚未充分探讨的攻击机会:通过恶意意图将偏见植入生成图像中,例如影响公众舆论并传播宣传。本文研究了一种允许对手将任意偏见注入目标模型的攻击向量。该攻击利用低成本的后门技术,通过一小组针对性的自然文本触发器嵌入少量恶意数据样本生成。对手可以选择常见的词语序列,然后在推理期间被善意的用户无意中激活。我们探讨了此类攻击的可行性与挑战,表明现代生成模型使这种对抗过程更加容易和更具适应性。另一方面,我们探讨了这些攻击的可检测性方面,表明在无触发器的情况下,模型的实用性得以维持。我们的广泛实验使用超过 20 万生成图像并针对数百个微调模型,证明了所提出后门攻击的可行性。我们说明这些偏见保持强大的文本-图像对齐,凸显在缺乏事先知道偏见的情况下检测偏见图像的挑战。我们的成本分析确认执行此类攻击的低财务门槛($10-$15),凸显需要针对扩散模型中此类漏洞制定稳健防御策略的必要性。
引用
@article{arxiv.2406.15213,
title = {Backdooring Bias ($B^2$) into Stable Diffusion Models},
author = {Ali Naseh and Jaechul Roh and Eugene Bagdasarian and Amir Houmansadr},
journal= {arXiv preprint arXiv:2406.15213},
year = {2025}
}
备注
Accepted to USENIX Security '25