生成“正常”图像:通过提示嵌入进行品牌注入攻击
密码学与安全
2026-05-12 v1
摘要
随着生成式 AI 的快速发展,用户越来越依赖图像生成模型进行图像设计和创作。为了实现可靠的输出,用户通常会在图像细化过程中进行多轮交互:先进行文本到图像生成,然后进行以文本为导向的图像到图像编辑。在本文中,我们调查了此类工作流程相关的新型安全漏洞。我们的关键洞察是,嵌入输入图像中的一个几乎不可见的提示(如品牌信息,例如 LOGO),可以被下游生成模型识别,并随后在语义上相关的对象上重新渲染出来,即使用户提示未明确提及它。这一形式的隐藏有效负载注入使攻击隐蔽性更强。我们研究了两种现实的攻击场景。第一种是基于钓鱼的场景,即攻击者控制在线图像生成服务,并在将图像返回用户之前注入隐藏内容。第二种是基于投毒的场景,即攻击者分发一个被篡改的文本到图像扩散模型,其输出包含隐藏内容。我们使用六个注入的有效负载进行评估,包括著名的 LOGO 和定制设计,演示两种攻击在平均成功率上分别为 44.4% 和 32.2%,同时确保注入的 LOGO 在视觉上几乎不可察觉。我们还开发了一种缓解方案,其对钓鱼式和投毒式攻击的平均成功率分别为 87.4% 和 92.3%。
引用
@article{arxiv.2605.10600,
title = {Generate "Normal", Edit Poisoned: Branding Injection via Hint Embedding in Image Editing},
author = {Desen Sun and Jason Hon and Howe Wang and Saarth Rajan and Meng Xu and Sihang Liu},
journal= {arXiv preprint arXiv:2605.10600},
year = {2026}
}