中文

FlowErase-RL:将流匹配模型中的概念擦除重新思考为奖励优化

计算机视觉与模式识别 2026-05-26 v2

摘要

流匹配模型的最新进展显著提升了文本到图像生成的质量,但也因生成有害或不良内容而带来了日益增长的安全风险。现有的概念擦除方法要么是效果有限的推理时干预,要么依赖于需要精确对齐数据且难以扩展和处理多概念设置的监督微调(SFT)。在本文中,我们提出FlowErase-RL,这是首个基于GRPO的流匹配模型概念擦除框架。我们将概念擦除重新表述为一个奖励优化问题,并引入一种动态双路径奖励机制,该机制联合优化(i)用于抑制目标概念的概念擦除(CE)奖励和(ii)用于保持生成保真度的非目标空间(NS)奖励。两条奖励路径在训练过程中通过性能驱动的切换策略自适应平衡,从而在无需显式监督的情况下实现稳定优化。在裸体、物体和艺术风格擦除上的大量实验表明,我们的方法在保持强大图像质量和语义对齐的同时,实现了最先进的擦除性能。此外,它表现出对对抗性攻击的鲁棒抵抗力,并能有效扩展到多概念场景。我们的结果为流匹配模型中的安全和可控生成建立了一个新范式。

关键词

引用

@article{arxiv.2605.19739,
  title  = {FlowErase-RL: Rethinking Concept Erasure as Reward Optimization in Flow Matching Models},
  author = {Yi Sun and Zhiqi Zhang and Xinhao Zhong and Yimin Zhou and Shuoyang Sun and Bin Chen and Shu-Tao Xia and Ke Xu},
  journal= {arXiv preprint arXiv:2605.19739},
  year   = {2026}
}