中文

基于评估器引导的文本到图像扩散模型反向学习

机器学习 2026-02-17 v3

摘要

文本到图像扩散模型的机器遗忘旨在在保留整体实用性的同时删除特定概念。先前的扩散遗忘方法通常依赖监督权重编辑或全局惩罚;强化学习方法虽然灵活,但常优化稀疏的轨迹末端奖励,导致高方差更新和弱信用分配。我们提出一种通用的基于强化学习的扩散遗忘框架,将去噪建模为顺序决策过程,并引入时步感知的评估器与带噪步奖励。具体而言,我们在带噪 latent 上训练基于 CLIP 的奖励预测器,并利用其逐步信号计算优势估计,以进行政策梯度更新扩散核。我们的算法易于实现,支持离策略重用,并可集成到标准的文本到图像主干模型中。在多个概念上,该方法在保持图像质量和良好提示忠诚度方面,优于或相当于强基线;消融实验表明 (i) 逐步评估器和 (ii) 带噪条件奖励是稳定性和有效性的关键因素。我们发布代码和评估脚本,以促进可重复性和基于强化学习的扩散遗忘未来研究。

关键词

引用

@article{arxiv.2601.03213,
  title  = {Critic-Guided Reinforcement Unlearning in Text-to-Image Diffusion},
  author = {Mykola Vysotskyi and Zahar Kohut and Mariia Shpir and Taras Rumezhak and Volodymyr Karpiv},
  journal= {arXiv preprint arXiv:2601.03213},
  year   = {2026}
}

备注

Preprint