DeContext 作为防御:扩散转换器中的安全图像编辑
计算机视觉与模式识别
2025-12-22 v2
摘要
基于情境的扩散模型允许用户轻松且逼真地修改图像。然而,同样的强大功能也引发了严重的隐私担忧:个人图像可被轻易用于身份冒充、虚假信息或其他恶意用途,均需所有者同意。虽然先前工作探索了输入扰动以保护针对个性化文本到图像生成的滥用,但现代大规模基于DiT的模型的鲁棒性仍基本未得到检验。本文提出了DeContext,一种新的方法来保护输入图像免受未经授权的情境编辑。我们的关键洞见是,来自源图像的情境信息主要通过多模态注意力层传播到输出。通过注入小的、有针对性的扰动来削弱这些交叉注意力路径,DeContext打破了这一流程,有效地解耦了输入与输出之间的联系。该方法简单且高效,鲁棒性强。我们进一步表明,早期去噪步骤和特定转换器块主导情境传播,这使我们能够集中注意力扰动。在Flux Kontext和Step1X-Edit上的实验表明,DeContext consistently阻止了不受欢迎的图像编辑,同时保持视觉质量。这些结果突显了注意力基于扰动作为防御图像操纵的有效方法。代码已公开:https://github.com/LinghuiiShen/DeContext。
引用
@article{arxiv.2512.16625,
title = {DeContext as Defense: Safe Image Editing in Diffusion Transformers},
author = {Linghui Shen and Mingyue Cui and Xingyi Yang},
journal= {arXiv preprint arXiv:2512.16625},
year = {2025}
}
备注
17 pages, 11 figures