中文

基于空间注意力遗忘的扩散模型后门防御

密码学与安全 2025-04-29 v1 人工智能 计算机视觉与模式识别

摘要

文本到图像扩散模型日益暴露于后门攻击,这类攻击通过修改训练数据,使模型在特定触发器出现时生成意外输出。尽管分类模型已有广泛防御机制开发,但生成模型因其高维输出空间而缺乏防御,因而难以检测和缓解细微扰动。针对扩散模型的防御策略仍鲜有探索。本文提出空间注意力遗忘(Spatial Attention Unlearning, SAU)技术,用于缓解扩散模型中的后门攻击。SAU 利用潜在空间操作和注意力机制来隔离和移除后门触发器的潜在表征,确保精准高效地移除恶意效果。我们在各种后门攻击类型上评估了 SAU,包括像素级和风格级触发器,展示其在实现 100% 触发器移除准确率方面的有效性。此外,SAU 获得 CLIP 分数 0.7023,超越现有方法,同时保持模型生成高质量、语义一致图像的能力。我们的结果表明,SAU 是一种稳健、可扩展且实用的解决方案,可保护文本到图像扩散模型免受后门攻击。

关键词

引用

@article{arxiv.2504.18563,
  title  = {Backdoor Defense in Diffusion Models via Spatial Attention Unlearning},
  author = {Abha Jha and Ashwath Vaithinathan Aravindan and Matthew Salaway and Atharva Sandeep Bhide and Duygu Nur Yaldiz},
  journal= {arXiv preprint arXiv:2504.18563},
  year   = {2025}
}