中文

差分向量擦除:面向流匹配模型的统一训练-free概念擦除方法

计算机视觉与模式识别 2026-02-03 v1

摘要

文本到图像扩散模型在生成高质量图像方面展现了卓越的能力,但其倾向于再现不可接受的概念(如 NSFW 内容、版权受保护的风格或特定物体)日益引发关于安全可控部署的广泛关注。虽然现有概念擦除方法主要关注基于 DDPM 的扩散模型,并依赖高昂的微调,但最近出现的流匹配模型引入了 fundamentally 不同的生成范式,先前的方法并不直接适用。本文提出差分向量擦除(DVE),这是一种专为流匹配模型设计的训练-free 概念擦除方法。我们的关键洞察是,语义概念在支配生成流的速度场方向结构中被隐式编码。基于此观察,我们构建一个差分向量场,以刻画目标概念与精心挑选的锚定概念之间的方向性差异。在推断过程中,DVE 通过将速度场投影到差分方向上,以选择性地移除概念特定的分量,实现精确的概念抑制,同时不影响无关语义。广泛的实验在 FLUX 上表明,DVE 在包括 NSFW 抑制、艺术风格移除和物体擦除在内的广泛范围内的概念擦除任务中 consistently 优于现有基线方法,同时保持图像质量和多样性。

关键词

引用

@article{arxiv.2602.01089,
  title  = {Differential Vector Erasure: Unified Training-Free Concept Erasure for Flow Matching Models},
  author = {Zhiqi Zhang and Xinhao Zhong and Yi Sun and Shuoyang Sun and Bin Chen and Shu-Tao Xia and Xuan Wang},
  journal= {arXiv preprint arXiv:2602.01089},
  year   = {2026}
}