生成式模型的极简概念抹除
计算机视觉与模式识别
2025-07-21 v1 机器学习
摘要
近期生成式模型在生成高质量图像方面展现出惊人的能力,但其依赖大规模无标签数据导致安全和版权问题日益突出。通过抹除不必要概念来解决这些问题的尝试已展现出前景。然而,许多现有抹除方法涉及过度修改,损害整体模型实用性。本文通过仅基于最终生成输出分布距离的目标函数,提出了一种新颖的极简概念抹除方法。基于我们的公式,我们推导出可通过端到端方式对所有生成步骤进行反向传播的可求解损失。我们还进行大量分析,展示与其他模型和方法的理论联系。为提高抹除的鲁棒性,我们采用神经元掩码作为替代模型微调的方案。在针对最先进的流匹配模型进行的实证评估表明,我们的方法能在不降低整体模型性能的前提下稳健地抹除概念,为更安全更负责任的生成式模型铺平了道路。
引用
@article{arxiv.2507.13386,
title = {Minimalist Concept Erasure in Generative Models},
author = {Yang Zhang and Er Jin and Yanfei Dong and Yixuan Wu and Philip Torr and Ashkan Khakzar and Johannes Stegmaier and Kenji Kawaguchi},
journal= {arXiv preprint arXiv:2507.13386},
year = {2025}
}
备注
ICML2025