中文

使用任务向量的鲁棒概念擦除

计算机视觉与模式识别 2025-02-21 v2

摘要

随着文本到图像模型的快速发展,人们提出了各种技术来防止不良图像生成。然而,这些方法通常只针对特定用户提示进行保护,并且已被证明在其他输入下仍可能产生不安全生成。本文聚焦于无条件地从文本到图像模型中擦除概念,而非根据用户提示进行条件擦除。我们首先证明,与依赖于输入的方法相比,使用任务向量(TV)进行概念擦除对训练中未见过的意外用户输入更为鲁棒。然而,基于TV的擦除也可能影响编辑模型的核心性能,尤其是在所需编辑强度未知时。为此,我们提出了一种称为“多样化反演”(Diverse Inversion)的方法,用于估计TV编辑所需的强度。多样化反演在模型输入空间中寻找大量词嵌入,每个词嵌入都能诱导目标概念的生成。我们发现,鼓励集合的多样性使我们的估计对意外提示更加鲁棒。最后,我们展示了多样化反演使我们能够仅对模型权重的子集应用TV编辑,从而增强擦除能力,同时更好地保持模型的核心功能。

关键词

引用

@article{arxiv.2404.03631,
  title  = {Robust Concept Erasure Using Task Vectors},
  author = {Minh Pham and Kelly O. Marshall and Chinmay Hegde and Niv Cohen},
  journal= {arXiv preprint arXiv:2404.03631},
  year   = {2025}
}