中文

结构破坏:通过自注意力查询扰动颠覆恶意扩散模型图像修复

计算机视觉与模式识别 2025-05-27 v1 密码学与安全 机器学习

摘要

扩散模型的快速发展提升了其图像修复与编辑能力,但也引入了重大的社会风险。攻击者可利用社交媒体上的用户图像生成误导性或有害内容。尽管对抗扰动可以破坏图像修复,但基于全局扰动的方法在掩码引导的编辑任务中因空间约束而失效。为应对这些挑战,我们提出了结构破坏攻击(Structure Disruption Attack, SDA),这是一种强大的保护框架,旨在保护敏感图像区域免受基于修复的编辑。基于扩散模型自注意力机制聚焦轮廓的特性,SDA 通过在初始去噪步骤中扰动自注意力中的查询来优化扰动,从而破坏轮廓生成过程。这种针对性干扰直接破坏了扩散模型的结构生成能力,有效阻止其生成连贯图像。我们通过可视化技术与在公开数据集上的大量实验验证了本文的动机,结果表明 SDA 在实现 SOTA 保护性能的同时保持了较强的鲁棒性。

关键词

引用

@article{arxiv.2505.19425,
  title  = {Structure Disruption: Subverting Malicious Diffusion-Based Inpainting via Self-Attention Query Perturbation},
  author = {Yuhao He and Jinyu Tian and Haiwei Wu and Jianqing Li},
  journal= {arXiv preprint arXiv:2505.19425},
  year   = {2025}
}