通过子空间投影实现安全可靠的扩散模型
计算机视觉与模式识别
2025-03-24 v1 机器学习
摘要
大规模文本到图像(T2I)扩散模型彻底改变了图像生成,使得从文本描述合成高度精细的视觉内容成为可能。然而,这些模型可能会无意中生成不当内容,例如受版权保护的作品或冒犯性图像。虽然现有方法试图消除特定的非期望概念,但它们往往无法确保完全移除,使得该概念以微妙的形式重新出现。例如,当显式提示 "Van Gogh" 时,模型可以成功避免生成 Van Gogh 风格的图像,但在给定提示 "Starry Night" 时仍可能复现其标志性作品。本文提出 SAFER,一种用于从扩散模型中彻底移除目标概念的新颖且高效的方法。从高层次上看,SAFER 的灵感来自于所观察到的文本嵌入空间的低维结构。该方法首先识别与目标概念 c 相关联的特定概念子空间 。然后将提示嵌入投影到 的正交补子空间上,从而有效地从生成图像中擦除该概念。由于概念可能是抽象的且难以仅用自然语言完全捕捉,我们采用 textual inversion 从参考图像中学习目标概念的优化嵌入。这使得子空间估计更加精确,并提升了移除性能。此外,我们引入子空间扩展策略以确保全面且鲁棒的概念擦除。大量实验表明,SAFER 能够持续且有效地从扩散模型中擦除非期望概念,同时保持生成质量。
引用
@article{arxiv.2503.16835,
title = {Safe and Reliable Diffusion Models via Subspace Projection},
author = {Huiqiang Chen and Tianqing Zhu and Linlin Wang and Xin Yu and Longxiang Gao and Wanlei Zhou},
journal= {arXiv preprint arXiv:2503.16835},
year = {2025}
}