中文

通过双投影实现概念擦除的闭形式解

机器学习 2026-04-14 v1 人工智能

摘要

虽然扩散基模型等现代生成模型展现出惊人的创造能力,但也带来了重要的安全与伦理风险。为此,人们对概念擦除(即从模型表示中移除不愿意出现的概念)表示浓厚兴趣。现有方法往往实现强效擦除,但依赖迭代优化,可能不可避免地扭曲无关概念。本文提出一种简单且原则化的替代方案:一种线性变换框架,可无需训练实现概念擦除的闭形式解。我们通过两步封闭形式步骤适配预训练模型:首先计算目标概念的代理投影,其次在已知概念方向的左零空间内施加受约束变换。该设计产生一种确定性、在几何上可解释的安全、高效且理论依据充足的概念移除程序。在广泛的实验中,包括对多种 Stable Diffusion 变体及 flow-matching 模型 (FLUX) 的对象和风格擦除,我们的方法在保持非目标概念更忠实的同时,匹配或超越了最新方法的性能。仅需数秒即可完成,为受控模型编辑提供了轻量级即插即用工具,推动了更安全更负责任的生成模型目标的实现。

关键词

引用

@article{arxiv.2604.10032,
  title  = {Closed-Form Concept Erasure via Double Projections},
  author = {Chi Zhang and Jingpu Cheng and Zhixian Wang and Ping Liu},
  journal= {arXiv preprint arXiv:2604.10032},
  year   = {2026}
}