中文

面向图像编辑模型的多模态后门攻击:TrojanEdit

密码学与安全 2025-06-02 v2

摘要

多模态扩散模型用于图像编辑会生成受文本指令和视觉输入条件化的输出,旨在修改目标区域 while preserving 其余图像。尽管扩散模型已显示出对后门攻击的脆弱性,但现有工作主要关注单模态生成模型,未能针对多模态图像编辑所特有的挑战进行探讨。本文首次研究了针对多模态基于扩散的数位图像编辑模型的后门攻击。我们研究了使用文本和视觉触发器来嵌入后门,该后门能够在保持模型正常功能的同时实现高攻击成功率。然而,我们识别出了一个关键模态偏差。仅仅组合来自不同模态的触发器会导致模型主要依赖其中一个模态,通常是视觉模态,这会导致多模态行为丢失并降低编辑质量。为克服这一问题,我们提出了 TrojanEdit—a 一种后门注入框架,可在训练期间动态调整每个模态的梯度贡献。这允许模型学习一种仅在两种触发器同时存在时才激活的真正多模态后门。大量实验表明,TrojanEdit 成功地集成了来自不同模态的触发器,实现了多模态后门的平衡学习,同时保持干净编辑性能,确保高攻击效能。

关键词

引用

@article{arxiv.2411.14681,
  title  = {TrojanEdit: Multimodal Backdoor Attack Against Image Editing Model},
  author = {Ji Guo and Peihong Chen and Wenbo Jiang and Xiaolei Wen and Jiaming He and Jiachen Li and Guoming Lu and Aiguo Chen and Hongwei Li},
  journal= {arXiv preprint arXiv:2411.14681},
  year   = {2025}
}