ZeroSmooth:面向高帧率视频生成的无训练扩散模型适配方法
计算机视觉与模式识别
2024-06-04 v1
摘要
近年来,视频生成取得了显著进展,尤其是视频扩散模型的出现。许多视频生成模型可以生成逼真的合成视频,例如稳定视频扩散(SVD)。然而,由于GPU内存有限以及建模大量帧的困难,大多数视频模型只能生成低帧率视频。训练视频总是以指定的间隔均匀采样以实现时间压缩。先前的方法要么在像素空间中训练视频插值模型作为后处理阶段,要么在潜在空间中为特定的基础视频模型训练插值模型。在本文中,我们提出了一种面向生成式视频扩散模型的无训练视频插值方法,该方法以即插即用的方式适用于不同模型。我们研究了视频扩散模型特征空间中的非线性,并通过引入设计的隐藏状态校正模块,将视频模型转换为自级联视频扩散模型。自级联架构和校正模块旨在保持关键帧与插值帧之间的时间一致性。我们在多个流行视频模型上进行了广泛评估,以证明所提出方法的有效性,特别是我们的无训练方法甚至可与由巨大计算资源和大规模数据集支持的有训练插值模型相媲美。
引用
@article{arxiv.2406.00908,
title = {ZeroSmooth: Training-free Diffuser Adaptation for High Frame Rate Video Generation},
author = {Shaoshu Yang and Yong Zhang and Xiaodong Cun and Ying Shan and Ran He},
journal= {arXiv preprint arXiv:2406.00908},
year = {2024}
}