SafeRedir:图像生成模型中实现鲁棒遗忘的提示嵌入重定向
计算机视觉与模式识别
2026-05-07 v2 人工智能
密码学与安全
机器学习
摘要
图像生成模型(IGM)虽然能够生成令人惊叹且富有创意的内容,但往往会从其训练数据中记忆大量不良概念,导致生成不安全内容,如 NSFW 图像和受版权保护的艺术风格。此类行为在现实部署中构成了持续的安全与合规风险,且由于事后过滤机制的鲁棒性有限且缺乏细粒度语义控制,无法可靠地缓解这些问题。近期的遗忘方法试图在模型层面抹除有害概念,但存在需要昂贵重训练、降低良性生成质量或无法抵御提示改写与对抗攻击等局限性。为了应对这些挑战,我们引入 SafeRedir,一个通过提示嵌入重定向实现鲁棒遗忘的轻量级推理时框架。在不修改底层 IGM 的情况下,SafeRedir 通过在嵌入空间中的 token 级干预,自适应地将不安全提示路由至安全语义区域。该框架包含两个核心组件:一个用于识别不安全生成轨迹的潜感知多模态安全分类器,以及一个用于精确语义重定向的 token 级 delta 生成器,后者配备了用于 token 掩码和自适应缩放的辅助预测器,以定位和调节干预。在多个代表性遗忘任务上的实验结果表明,SafeRedir 实现了有效的遗忘能力、高度的语义与感知保留、鲁棒的图像质量,并增强了对对抗攻击的抵抗力。此外,SafeRedir 能够有效泛化至多种扩散骨干和现有的已遗忘模型,验证了其即插即用的兼容性和广泛适用性。代码和数据可在 https://github.com/ryliu68/SafeRedir 获取。
引用
@article{arxiv.2601.08623,
title = {SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models},
author = {Renyang Liu and Kangjie Chen and Han Qiu and Jie Zhang and Kwok-Yan Lam and Tianwei Zhang and See-Kiong Ng},
journal= {arXiv preprint arXiv:2601.08623},
year = {2026}
}
备注
Code at https://github.com/ryliu68/SafeRedir