中文

面向文本到视频扩散模型的概念遗忘

机器学习 2025-08-29 v2 计算机视觉与模式识别

摘要

随着计算机视觉和自然语言处理的进步,文本到视频生成变得越来越普遍,这得益于文本到视频扩散模型。这些模型是使用来自互联网的大量数据训练的。然而,训练数据常常包含受版权保护的内容,包括动画人物图标和艺术家风格、私人肖像以及不安全的视频内容。由于筛选数据和重新训练模型具有挑战性,人们正在研究消除文本到视频扩散模型中特定概念的方法。然而,由于高计算复杂度和较大的优化规模,针对文本到视频扩散模型的遗忘方法几乎没有研究。我们提出了一种新的概念遗忘方法,通过将文本到图像扩散模型的遗忘能力转移到文本到视频扩散模型中。具体而言,该方法通过少量样本的遗忘来优化文本编码器,其中几个生成图像被用于优化。随后,我们将优化后的文本编码器用于文本到视频扩散模型生成视频。该方法计算资源需求低,优化规模小。我们讨论了在遗忘概念后生成的视频。实验表明,该方法能够遗忘受版权保护的动画人物、艺术家风格、物体和人脸特征。在RTX 3070上,该方法约100秒即可遗忘一个概念。由于此前没有针对文本到视频扩散模型的概念遗忘方法,本工作使文本到视频领域的概念遗忘变得可行且更易于实现。

关键词

引用

@article{arxiv.2407.14209,
  title  = {Unlearning Concepts from Text-to-Video Diffusion Models},
  author = {Shiqi Liu and Yihua Tan},
  journal= {arXiv preprint arXiv:2407.14209},
  year   = {2025}
}