擦除概念,引导生成:概念抑制方法综述
计算机视觉与模式识别
2025-05-30 v2
摘要
文本到图像 (T2I) 模型在从自然语言提示生成高质量和多样化视觉内容方面展现了出色的能力。然而,敏感、受版权保护或有害图像的不可控复制带来了严重的伦理、法律和安全挑战。为了解决这些问题,概念擦除范式作为一种有前景的方向应运而生,它能够在保持生成模型整体效用的同时,选择性地从模型中移除特定的语义概念。本综述对 T2I 扩散模型中的概念擦除技术进行了全面概述和深入综合。我们沿着三个关键维度对现有方法进行系统分类:干预级别,即确定用于移除概念的特定模型组件;优化结构,指为实现抑制而采用的算法策略;以及语义范围,涉及所处理概念的复杂性和性质。这种多维分类法能够对各种方法进行清晰、结构化的比较,突出了擦除特异性、泛化能力和计算复杂度之间的基本权衡。我们进一步讨论了当前的评价基准、标准化指标和实用数据集,强调了限制全面评估的差距,特别是在鲁棒性和实际有效性方面。最后,我们概述了主要挑战和有前景的未来方向,包括概念表示的解耦、自适应和增量擦除策略、对抗鲁棒性以及新的生成架构。本综述旨在指导研究人员构建更安全、更符合伦理的生成模型,为推进生成式 AI 的负责任发展提供基础知识和可操作的建议。
引用
@article{arxiv.2505.19398,
title = {Erasing Concepts, Steering Generations: A Comprehensive Survey of Concept Suppression},
author = {Yiwei Xie and Ping Liu and Zheng Zhang},
journal= {arXiv preprint arXiv:2505.19398},
year = {2025}
}