中文

SAGE:通过语义增强擦除探索不安全概念域的边界

计算机视觉与模式识别 2025-06-12 v1 人工智能 密码学与安全

摘要

扩散模型(DMs)在文本到图像生成方面取得了显著进展。然而,预训练过程中不可避免地包含敏感信息,带来了安全风险,如不安全内容生成和版权侵犯。概念擦除通过微调权重来取消学习不期望的概念,已成为一项有前景的解决方案。然而,现有方法将不安全概念视为固定词汇并反复擦除,使 DMs 陷入"词汇概念深渊",从而阻碍了泛化的概念相关擦除。为逃离这一深渊,我们引入了语义增强擦除,通过循环自检与自擦除将概念词汇擦除转化为概念域擦除。它通过原始模型与训练模型之间的语义空间关系,高效地探索和取消学习概念域的边界表示,而无需额外的预处理数据。同时,为缓解在擦除不安全概念时无关概念的保留退化,我们进一步提出了全局-局部协同保留机制,将全局语义关系对齐与局部预测噪声保留相结合,有效扩大了无关概念的保留感受野。我们将我们的方法命名为 SAGE,大量实验证明了 SAGE 相比其他方法在扩散模型安全生成方面的全面优越性。代码和模型权重将在 https://github.com/KevinLight831/SAGE 开源。

关键词

引用

@article{arxiv.2506.09363,
  title  = {SAGE: Exploring the Boundaries of Unsafe Concept Domain with Semantic-Augment Erasing},
  author = {Hongguang Zhu and Yunchao Wei and Mengyu Wang and Siyu Jiao and Yan Fang and Jiannan Huang and Yao Zhao},
  journal= {arXiv preprint arXiv:2506.09363},
  year   = {2025}
}

备注

Under review