视频扩散中的时间建模重定义:向量化时间步方法
计算机视觉与模式识别
2024-10-07 v1 机器学习
摘要
扩散模型已彻底革新了图像生成,而将其扩展到视频生成也展现出广泛前景。然而,当前的视频扩散模型(VDM)依赖于应用于整片剪辑级别的标量时间步变量,这限制了其捕捉诸多任务(如图像到视频生成)所需复杂时间依赖关系的能力。为此,我们提出一种帧感知视频扩散模型(FVDM),引入一种新颖的向量化时间步变量(VTV)。不同于常规 VDM,本方法允许每帧遵循独立的噪声schedule,从而增强模型捕捉细粒度时间依赖关系的能力。FVDM 的灵活性通过多种 VTV 配置在多个任务中得到验证,包括常规视频生成、图像到视频生成、视频插值和长视频合成。通过多样化的 VTV 配置,我们在生成视频质量方面实现了优于最新方法的卓越表现,克服了在微调期间遗忘 catastrophic forgetting 和零样本方法通用性有限等挑战。我们的实证评估表明,FVDM 在视频生成质量上超越了最新方法,同时在扩展任务中也表现出色。通过解决现有 VDM 的根本性不足,FVDM 为视频合成树立了新范式,提供了一个具有显著意义的生成模型和多媒体应用前景的稳健框架。
引用
@article{arxiv.2410.03160,
title = {Redefining Temporal Modeling in Video Diffusion: The Vectorized Timestep Approach},
author = {Yaofang Liu and Yumeng Ren and Xiaodong Cun and Aitor Artola and Yang Liu and Tieyong Zeng and Raymond H. Chan and Jean-michel Morel},
journal= {arXiv preprint arXiv:2410.03160},
year = {2024}
}
备注
Code at https://github.com/Yaofang-Liu/FVDM