SF-V:单前向视频生成模型
计算机视觉与模式识别
2024-10-28 v2 图像与视频处理
摘要
扩散式视频生成模型通过迭代去噪过程已展现出获取高保真视频的显著成功,但这些模型在采样过程中需要多次去噪步骤,导致计算成本高昂。本文提出一种新方法,利用对抗训练微调预训练视频扩散模型,以实现单步骤视频生成。我们展示,通过对抗训练,多步骤视频扩散模型(即Stable Video Diffusion, SVD)可被训练执行单次前向传递来合成高质量视频,同时捕获视频数据中的时空依赖性。大量实验表明,我们的方法在显著降低去噪过程计算开销的同时(即相较于SVD加速约,相较于现有工作加速约),实现了与综合性视频合成质量相当,甚至更佳,为实时视频合成与编辑铺平了道路。更多可视化结果已公开于https://snap-research.github.io/SF-V。
引用
@article{arxiv.2406.04324,
title = {SF-V: Single Forward Video Generation Model},
author = {Zhixing Zhang and Yanyu Li and Yushu Wu and Yanwu Xu and Anil Kag and Ivan Skorokhodov and Willi Menapace and Aliaksandr Siarohin and Junli Cao and Dimitris Metaxas and Sergey Tulyakov and Jian Ren},
journal= {arXiv preprint arXiv:2406.04324},
year = {2024}
}
备注
Project Page: https://snap-research.github.io/SF-V