TraSCE:面向概念擦除的轨迹引导
计算机视觉与模式识别
2025-03-18 v2 人工智能
机器学习
摘要
文本到图像扩散模型的最新进展使其进入公众视野,变得广泛可及并被日常用户所接受。然而,这些模型已被证明会生成有害内容,例如不安全(NSFW)图像。虽然已有方法被提出用于从模型中擦除此类抽象概念,但越狱技术已成功绕过此类安全措施。在本文中,我们提出 TraSCE,一种引导扩散轨迹远离生成有害内容的方法。我们的方法基于负向提示,但正如我们在本文中所展示的,广泛使用的负向提示策略并非完整解决方案,在某些极端情况下很容易被绕过。为了解决这个问题,我们首先提出使用一种特定形式的负向提示,而非广泛使用的那种。此外,我们引入了一种基于局部损失的引导,通过引导扩散轨迹来增强改进后的负向提示技术。我们证明,所提出的方法在移除有害内容(包括红队提出的内容)以及擦除艺术风格和对象的各种基准测试中,均取得了最先进的结果。我们提出的方法不需要任何训练、权重修改或训练数据(无论是图像还是提示),使模型所有者更容易擦除新概念。
引用
@article{arxiv.2412.07658,
title = {TraSCE: Trajectory Steering for Concept Erasure},
author = {Anubhav Jain and Yuya Kobayashi and Takashi Shibuya and Yuhta Takida and Nasir Memon and Julian Togelius and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2412.07658},
year = {2025}
}