中文

ReLAPSe:基于强化学习训练的作废概念对抗性提示搜索

计算机视觉与模式识别 2026-02-03 v1

摘要

机器遗忘是从文本到图像扩散模型中移除未授权概念的关键防御机制,但近期证据表明,在遗忘后,潜在视觉信息常常持久存在。现有的对抗方法受到根本性限制:基于优化的方法因 per-instance 迭代搜索而计算昂贵;而基于推理和启发式技术缺乏来自目标模型潜在视觉表示的直接反馈。为此,我们引入ReLAPSe,一个基于策略的对抗框架,将概念恢复重新表述为强化学习问题。ReLAPSe使用可验证奖励(RLVR)训练智能体,利用扩散模型的噪声预测损失作为模型内在且可验证的反馈信号。该闭环设计直接将文本提示操作与潜在视觉残差对齐,使智能体能够学习可迁移的恢复策略,而不仅仅是优化孤立提示。通过从 per-instance 优化转向全局策略学习的 pioneering 方式,ReLAPSe实现了对多种最先进遗忘方法的精细身份和风格的高效、接近实时的恢复,为对遗忘扩散模型进行严格的红队测试提供了可扩展工具。一些实验评估涉及敏感视觉概念,如裸体。代码地址:https://github.com/gmum/ReLaPSe

关键词

引用

@article{arxiv.2602.00350,
  title  = {ReLAPSe: Reinforcement-Learning-trained Adversarial Prompt Search for Erased concepts in unlearned diffusion models},
  author = {Ignacy Kolton and Kacper Marzol and Paweł Batorski and Marcin Mazur and Paul Swoboda and Przemysław Spurek},
  journal= {arXiv preprint arXiv:2602.00350},
  year   = {2026}
}