中文

针对文本到图像扩散模型的隐式偏见注入攻击

计算机视觉与模式识别 2025-04-03 v1 人工智能

摘要

文本到图像扩散模型(T2I DMs)的兴起导致AI生成图像在日常生活中呈现增加。然而,偏见的T2I模型可以生成具有特定倾向性的内容,从而可能影响人们的感知。有意识地利用这些偏见风险可能向公众传递误导性信息。当前研究主要针对具有可识别视觉模式的显式偏见进行,如肤色和性别。这篇论文引入了一种新的隐式偏见形式,缺乏显式视觉特征,但可在各种语义上下文中以多种方式呈现。这种微妙且多功能的特性使这种偏见难以检测、容易传播,并且适用于广泛的场景。我们进一步提出了一种针对文本到图像扩散模型的隐式偏见注入攻击框架(IBI-Attacks),通过预计算提示嵌入空间中的通用偏见方向,并根据不同输入进行自适应调整。我们的攻击模块可以无缝集成到预训练扩散模型中,以即插即用方式集成,无需直接操作用户输入或模型重新训练。大量实验验证了我们方案在保持原始语义的同时,通过微妙且多样的修改引入偏见的有效性。我们攻击的强力隐蔽性和跨场景的可迁移性进一步凸显了我们方法的重要性。代码可在https://github.com/Hannah1102/IBI-attacks获取。

关键词

引用

@article{arxiv.2504.01819,
  title  = {Implicit Bias Injection Attacks against Text-to-Image Diffusion Models},
  author = {Huayang Huang and Xiangye Jin and Jiaxu Miao and Yu Wu},
  journal= {arXiv preprint arXiv:2504.01819},
  year   = {2025}
}

备注

Accept to CVPR 2025