FameBias: Embedding Manipulation Bias Attack in Text-to-Image Models
计算机视觉与模式识别
2024-12-25 v1 密码学与安全
机器学习
摘要
文本到图像 (T2I) diffusion 模型取得了快速进展,能够生成与文本描述高度吻合的高质�图像。然而,这种进展也引发了将其用于宣传及其他恶意活动的担忧。最近的研究表明,攻击者可以通过简单的微调将偏见嵌入这些模型,使其在特定短语触发时生成针对性图像。这进一步凸显了 T2I 模型可能成为宣传工具的潜力,为最终用户生成符合攻击者目标的图像。基于此概念,我们引入 FameBias,这是一种 T2I 偏见攻击,通过操控输入提示的嵌入向量来生成包含特定公众人物的图像。不同于先前方法,FameBias 仅 operates on input embedding vectors,无需额外模型训练。我们使用 Stable Diffusion V2 进行了全面评估,基于各种触发名词和目标公众人物生成大量图像。我们的实验表明,FameBias 在保持原始提示语义语境的同时,实现了高攻击成功率,并在多种触发-目标配对中表现出色。
引用
@article{arxiv.2412.18302,
title = {FameBias: Embedding Manipulation Bias Attack in Text-to-Image Models},
author = {Jaechul Roh and Andrew Yuan and Jinsong Mao},
journal= {arXiv preprint arXiv:2412.18302},
year = {2024}
}