逐帧熟悉:理解视频扩散模型中的复制现象
计算机视觉与模式识别
2024-11-01 v2
摘要
在图像生成扩散模型的发展势头之上,人们对基于视频的扩散模型的兴趣日益浓厚。然而,由于其更高维的性质、训练数据的稀缺以及复杂的时空关系,视频生成面临着更大的挑战。图像生成模型由于需要大量数据,已经将计算资源逼至极限。已有这些模型重现训练样本中元素的实例,引发了对样本复制的担忧甚至法律纠纷。视频扩散模型在更为有限的数据集下运行,且需要生成空间和时间内容,可能更容易从其训练集中复制样本。使问题更加复杂的是,这些模型通常使用无意中奖励复制的指标进行评估。在本文中,我们对视频扩散模型中的样本复制现象进行了系统调查。我们审视了近期用于视频合成的各种扩散模型,评估了它们在无条件和条件生成场景中复制空间和时间内容的倾向。我们的研究确定了不太可能导致复制的策略。此外,我们提出了考虑复制现象的新评估策略,为衡量模型生成原创内容的能力提供了更准确的度量。
引用
@article{arxiv.2403.19593,
title = {Frame by Familiar Frame: Understanding Replication in Video Diffusion Models},
author = {Aimon Rahman and Malsha V. Perera and Vishal M. Patel},
journal= {arXiv preprint arXiv:2403.19593},
year = {2024}
}