中文

PromptFlare:通过交叉注意力诱饵实现提示泛化的防御——基于扩散的图像修复

计算机视觉与模式识别 2025-08-25 v1

摘要

扩散模型的成功实现了轻松、高质量的图像修改,精确对齐用户意图,从而引发了关于其可能被恶意行为者滥用的担忧。先前的研究试图通过对抗攻击来缓解此类滥用。然而,这些方法严重依赖图像级不一致性,这在应对文本提示的影响方面存在根本性局限。在本文中,我们提出了 PromptFlare,一种新型对抗保护方法,旨在保护图像免受基于扩散的图像修复模型助长的恶意修改。我们的方法利用交叉注意力机制来利用提示嵌入的内在特性。具体而言,我们识别并针对提示中不变且语义无信息的共享标记,注入对抗性噪声以抑制采样过程。注入的噪声充当交叉注意力诱饵,将模型的注意力从有意义的提示-图像对齐处引开,从而中和提示的影响。在 EditBench 数据集上的大量实验表明,我们的方法在各种指标上取得了最先进性能,同时显著降低了计算开销和 GPU 内存使用。这些发现凸显了 PromptFlare 作为抵御未经授权图像篡改的鲁棒且高效的防护手段。代码可在 https://github.com/NAHOHYUN-SKKU/PromptFlare 获取。

关键词

引用

@article{arxiv.2508.16217,
  title  = {PromptFlare: Prompt-Generalized Defense via Cross-Attention Decoy in Diffusion-Based Inpainting},
  author = {Hohyun Na and Seunghoo Hong and Simon S. Woo},
  journal= {arXiv preprint arXiv:2508.16217},
  year   = {2025}
}

备注

Accepted to ACM MM 2025