文本到图像扩散模型中的概念多样化遗忘
人工智能
2026-03-20 v1
摘要
概念遗忘已成为减少文本到图像扩散模型中有害内容生成风险的有前景方向,通过选择性擦除模型参数中的不希望概念。现有方法通常依赖关键词来识别要遗忘的目标概念。然而,我们表明,这种基于关键词的表述方法本质上受限:视觉概念是多维的,可以以多种文本形式表达,常与相关概念在潜在空间中重叠,使得仅用关键词进行遗忘——该方法对目标概念的指示不够精确——脆弱且容易遗忘不相关概念。由于单个关键词仅表示概念的狭窄点估计,无法覆盖其完整语义分布和潜在空间中 entangled 的变化。为解决这一局限,我们提出了多样化遗忘,这是一种分布式框架,通过一组在语境上多样化的提示来表示概念,而非单个关键词。这种更丰富的表述使我们能够实现更精确、更稳健的遗忘。通过多个基准和最先进的基线进行大量实验,我们展示了将多样化遗忘作为集成到现有遗忘管道中的附加组件,始终实现更强的擦除、更好地保留无关概念以及更好的对抗性恢复攻击的鲁棒性。
引用
@article{arxiv.2603.18767,
title = {A Concept is More Than a Word: Diversified Unlearning in Text-to-Image Diffusion Models},
author = {Duc Hao Pham and Van Duy Truong and Duy Khanh Dinh and Tien Cuong Nguyen and Dien Hy Ngo and Tuan Anh Bui},
journal= {arXiv preprint arXiv:2603.18767},
year = {2026}
}