中文

一种可保留可用性的文本图像协同擦除框架

计算机视觉与模式识别 2025-05-27 v2 人工智能

摘要

概念擦除(concept erasing)最近作为一种有效的范式出现,旨在防止文本到图像扩散模型生成视觉上不可接受甚至有害的内容。然而,当前的擦除方法高度依赖手动构建的文本提示,这使得在保持高擦除效果(efficacy)的同时最小化对其他良好概念的影响(usability)具有挑战性。在本文中,我们归因于文本和图像模态之间固有的差距,这使得从文本提示中传递精细 entangled 的概念知识到图像生成过程中变得困难。为此,我们提出了一种通过直接整合视觉监督进入擦除过程的新方案,引入了首个文本图像协同概念擦除(Collaborative Concept Erasing, Co-Erasing)框架。具体而言,Co-Erasing通过文本提示和对应的由提示诱导的不可接受图像联合描述概念,然后通过负向引导来降低目标概念的生成概率。该方法有效地绕过了文本和图像之间的知识差距,显著提升了擦除效果。此外,我们设计了一种文本引导的图像概念细化策略,引导模型聚焦于与指定文本概念最相关的视觉特征,从而最小化对其他良好概念的干扰。最终,全面实验表明,Co-Erasing在在有效性和可用性之间取得更好的权衡,显著优于当前最先进的擦除方法。代码已公开于 https://github.com/Ferry-Li/Co-Erasing。

关键词

引用

@article{arxiv.2505.11131,
  title  = {One Image is Worth a Thousand Words: A Usability Preservable Text-Image Collaborative Erasing Framework},
  author = {Feiran Li and Qianqian Xu and Shilong Bao and Zhiyong Yang and Xiaochun Cao and Qingming Huang},
  journal= {arXiv preprint arXiv:2505.11131},
  year   = {2025}
}

备注

This paper has been accepeted to ICML 2025