中文

重新思考和红队化:针对个性化扩散模型中的保护性扰动

计算机视觉与模式识别 2026-05-18 v7 人工智能 密码学与安全

摘要

个性化扩散模型 (PDMs) 已成为通过最小训练数据适应预训练文本到图像模型以生成特定主体图像的热门方法。然而,PDMs 对微小对抗性扰动极其脆弱,当针对受损数据集进行微调时,性能会显著下降。这些漏洞被利用以创建保护性扰动,以防止未经授权的图像生成。现有的净化方法试图红队化保护性扰动以破坏保护,但常常过度净化图像,导致信息丢失。本文从捷径学习的角度深入分析了 PDMs 的微调过程。我们假设并经验性地证明,对抗性扰动会导致 CLIP 嵌入空间中图像与其文本提示之间的潜在空间错位。这种错位导致模型在微调期间错误地将噪声模式与唯一标识符关联,从而导致泛化不足。基于这些见解,我们提出了一个系统性的红队化框架,包括数据净化和对比解耦学习。我们首先采用即插即用的图像修复技术,在潜在空间中重新对齐图像与其原始语义内容。然后,我们引入带噪声标记的对比解耦学习,以解耦个性化概念与无意义噪声模式的学习。我们的研究不仅揭示了 PDMs 中的捷径学习漏洞,还为开发更强大的保护提供了全面的评估框架。我们的广泛评估表明,该方法优于现有净化方法,在针对自适应扰动时具有更好的鲁棒性。

关键词

引用

@article{arxiv.2406.18944,
  title  = {Rethinking and Red-Teaming Protective Perturbation in Personalized Diffusion Models},
  author = {Yixin Liu and Ruoxi Chen and Xun Chen and Lichao Sun},
  journal= {arXiv preprint arXiv:2406.18944},
  year   = {2026}
}

备注

Code is available at https://github.com/liuyixin-louis/DiffShortcut