REDEditing:基于文本到图像扩散模型的关系驱动精确后门投毒
密码学与安全
2025-04-22 v1 计算机视觉与模式识别
摘要
生成式 AI 的快速发展凸显了文本到图像 (T2I) 安全的重要性,尤其是后门投毒威胁。及时披露和缓解 T2I 模型中的安全漏洞对于确保生成模型的安全部署至关重要。我们探索了一种通过模型编辑实现的新型训练免费后门投毒范式,这种方法最近被用于大型语言模型的知识更新。然而,我们揭示了模型编辑技术对图像生成模型所潜在的安全风险。本文建立了基于模型编辑的后门攻击原理,提出了一种关系驱动的精确后门投毒方法 REDEditing。基于等价属性对齐和隐形投毒的原理,我们发展了等价关系检索和联合属性迁移方法,以确保通过概念重新绑定实现一致的后门图像生成。提出了一种知识隔离约束,以保留良性生成的完整性。我们的方法比最先进的方法实现了 11% 的更高攻击成功率。令人惊讶的是,仅需添加一行代码即可提升输出的自然性,同时将后门隐形性提升 24%。本工作旨在提高人们对可编辑图像生成模型中这一安全漏洞的 awareness。
引用
@article{arxiv.2504.14554,
title = {REDEditing: Relationship-Driven Precise Backdoor Poisoning on Text-to-Image Diffusion Models},
author = {Chongye Guo and Jinhu Fu and Junfeng Fang and Kun Wang and Guorui Feng},
journal= {arXiv preprint arXiv:2504.14554},
year = {2025}
}
备注
10 pages, 7 figures