撕毁记忆:基于强化学习的扩散模型轨迹优化以复活被抹除的概念
机器学习
2025-10-07 v1 计算机视觉与模式识别
摘要
概念擦除技术已在 T2I 扩散模型中广泛部署,以防止不当内容的生成,从而满足安全和版权考虑。然而,随着模型向下一代架构(如 Flux)演进,既定的擦除方法(如 ESD、UCE、AC)显示出效能下降,这引发了对其真实机制的质疑。通过系统性分析,我们揭示概念擦除仅制造了“记忆丧失”的幻象:实际上并非真正的遗忘,而是这些方法偏向于引导采样轨迹远离目标概念,使擦除本质上是可逆的。这一洞见促使我们需要区分表面的安全与真正的概念删除。在本工作中,我们提出了 RevAm(Revoking Amnesia),一个基于强化学习的轨迹优化框架,通过动态引导去噪过程来复活被抹除的概念,且无需修改模型权重。通过将群体相对策略优化(GRPO)适用于扩散模型,RevAm 通过轨迹级奖励探索多样化的恢复轨迹,克服了现有方法所局限于局部最优的限制。大量实验表明,RevAm 在实现卓越的概念复活保真度方面表现优异,同时将计算时间缩短了 10 倍,暴露了当前安全机制的关键漏洞,凸显了超越轨迹操作之外更健壮擦除技术的必要性。
引用
@article{arxiv.2510.03302,
title = {Revoking Amnesia: RL-based Trajectory Optimization to Resurrect Erased Concepts in Diffusion Models},
author = {Daiheng Gao and Nanxiang Jiang and Andi Zhang and Shilin Lu and Yufei Tang and Wenbo Zhou and Weiming Zhang and Zhaoxin Fan},
journal= {arXiv preprint arXiv:2510.03302},
year = {2025}
}
备注
21 pages, 10 figures