VENhancer:用于视频生成的生成式时空提升框架
计算机视觉与模式识别
2024-07-11 v1 图像与视频处理
摘要
我们提出 VEnhancer,一种生成式时空提升框架,用于改善现有文本到视频结果,在空间域添加更多细节以及在时间域合成详细运动。给定一个生成的低质量视频,本方法可通过统一的视频扩散模型在任意空空间和时间尺度下同时提升其空间和时间分辨率。此外,VENhancer 有效去除生成视频中的空间性工件和时间性闪烁。为实现此目标,基于预训练视频扩散模型,我们训练一个视频 ControlNet 并将其注入扩散模型作为低帧率和低分辨率视频的条件。为有效训练此视频 ControlNet,我们设计了时空数据增强以及视频感知条件。凭借上述设计,VENhancer 在训练期间保持稳定,并采用优雅的端到端训练方式。广泛实验表明,VENhancer 在提升 AI 生成视频方面优于现有最先进的视频超分辨率和时空超分辨率方法。此外,借助 VEnhancer,现有的开源最先进文本到视频方法 VideoCrafter-2 在视频生成基准测试 VBench 中名列前茅。
引用
@article{arxiv.2407.07667,
title = {VEnhancer: Generative Space-Time Enhancement for Video Generation},
author = {Jingwen He and Tianfan Xue and Dongyang Liu and Xinqi Lin and Peng Gao and Dahua Lin and Yu Qiao and Wanli Ouyang and Ziwei Liu},
journal= {arXiv preprint arXiv:2407.07667},
year = {2024}
}
备注
technical report