中文

面向基础文本到图像模型的持续反学习与泛化侵蚀防护

计算机视觉与模式识别 2025-03-25 v2

摘要

如何在不进行大量重新训练的情况下,有效地从预训练的生成式基础模型中消去选定概念?本研究提出了'持续反学习'(continual unlearning)这一新颖范式,能够逐步地从基础生成式模型中有针对性地移除多个特定概念。我们提出了无泛化侵蚀递减消去学习(DUGE)算法,该算法选择性地消去不期望概念的生成,同时保留相关非目标概念的生成,并缓解泛化侵蚀。为此,DUGE 针对三种损失函数:交叉注意力损失,将焦点引导至不含目标概念的图像;先验保持损失,保护与非目标概念相关的知识;以及正则化损失,防止模型遭受泛化侵蚀。实验结果表明,所提方法能够在不损害模型整体完整性与性能的前提下排除某些概念。这为优化生成式模型提供了一种务实的解决方案,能够巧妙处理模型训练与概念管理的复杂性,降低版权侵权、个人或授权材料滥用以及独特艺术风格复制的风险。重要的是,它保留了非目标概念,从而保护了模型的核心能力与有效性。

关键词

引用

@article{arxiv.2503.13769,
  title  = {Continual Unlearning for Foundational Text-to-Image Models without Generalization Erosion},
  author = {Kartik Thakral and Tamar Glaser and Tal Hassner and Mayank Vatsa and Richa Singh},
  journal= {arXiv preprint arXiv:2503.13769},
  year   = {2025}
}

备注

Under submission to T-PAMI