通过深度水印实现的图像编辑模型中不可见的后门触发器
计算机视觉与模式识别
2025-06-06 v1
摘要
扩散模型在图像生成和编辑方面取得了显著进展。然而,近期研究揭示了其对后门攻击的脆弱性,即特定模式嵌入输入中可操控模型行为。目前大多数研究聚焦于图像生成流程,导致后门攻击在图像编辑领域鲜有涉及。针对图像编辑的研究大多使用可见触发器,而这在实际中不可行,因为会在编辑前对输入图像引入明显变更。本文提出一种新颖的攻击框架,通过受污染的训练数据在图像编辑过程中嵌入不可见触发器。我们利用现成的深度水印模型对不可察觉的水印进行编码作为后门触发器。目标是使模型在接收水印输入时产生预定义的后门目标,而在给定提示下正常编辑干净图像。通过对不同水印模型进行大量实验,所提方法实现了有希望的攻击成功率。此外,关于水印特征在后门攻击方面的分析结果进一步支持了我们方法的有效性。代码已公开:https://github.com/aiiu-lab/BackdoorImageEditing
引用
@article{arxiv.2506.04879,
title = {Invisible Backdoor Triggers in Image Editing Model via Deep Watermarking},
author = {Yu-Feng Chen and Tzuhsuan Huang and Pin-Yen Chiu and Jun-Cheng Chen},
journal= {arXiv preprint arXiv:2506.04879},
year = {2025}
}