中文

PersGuard:基于后门攻击防止恶意个人化的文本到图像扩散模型

计算机视觉与模式识别 2025-02-25 v1 人工智能

摘要

扩散模型(DM)在数据生成领域取得了突破性进展,尤其是在文本到图像(T2I)合成中。然而,个人化生成模型的广泛应用引发了关于隐私侵犯和版权侵权的严重关注。为解决这些问题,研究人员提出了基于对抗扰动的保护技术。然而,这些方法存在显著局限性,包括对数据转换的鲁棒性不足以及无法完全消除受保护对象的可识别特征。本文引入PersGuard,一种基于后门的方法,用于防止特定图像的恶意个人化。不同于传统的对抗扰动方法,PersGuard在预训练的T2I模型中植入后门触发器,防止针对指定受保护图像生成定制化输出,同时允许对未受保护的图像进行正常个人化。然而,现有的T2I扩散模型后门方法由于后门目标不同以及下游微调过程中的潜在后门消除,难以应用于个人化场景。为解决这些问题,我们提出了三个专为个人化场景设计的新型后门目标,搭配抗下游微调的后门保留损失。这些组件集成到统一的优化框架中。广泛的实验评估表明,PersGuard在数据隐私保护方面具有有效性,即使在包括灰盒设置、多对象保护和面部身份场景等具有挑战性条件下也能表现出色。我们的方法显著优于现有技术,为隐私和版权保护提供了更稳健的解决方案。

关键词

引用

@article{arxiv.2502.16167,
  title  = {PersGuard: Preventing Malicious Personalization via Backdoor Attacks on Pre-trained Text-to-Image Diffusion Models},
  author = {Xinwei Liu and Xiaojun Jia and Yuan Xun and Hua Zhang and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2502.16167},
  year   = {2025}
}