GenDeF:学习用于视频生成的生成式变形场
计算机视觉与模式识别
2023-12-08 v1
摘要
我们为视频生成任务提供了一个新的视角。我们不是直接合成一系列帧,而是提出通过用一个生成式变形场(GenDeF)扭曲一张静态图像来渲染视频。这样的流程具有三个吸引人的优势。首先,我们可以充分重用训练有素的图像生成器来合成静态图像(也称为规范图像),从而减轻了生成视频的难度,进而获得更好的视觉质量。其次,我们可以轻松地将变形场转换为光流,从而可以对运动建模应用显式的结构正则化,得到时间上一致的结果。第三,内容与运动的解耦允许用户通过处理其对应的静态图像来处理合成视频,而无需任何调整,这有助于许多应用,如视频编辑、关键点跟踪和视频分割。在三个常见视频生成基准上的定性和定量结果都证明了我们GenDeF方法的优越性。
引用
@article{arxiv.2312.04561,
title = {GenDeF: Learning Generative Deformation Field for Video Generation},
author = {Wen Wang and Kecheng Zheng and Qiuyu Wang and Hao Chen and Zifan Shi and Ceyuan Yang and Yujun Shen and Chunhua Shen},
journal= {arXiv preprint arXiv:2312.04561},
year = {2023}
}
备注
Project page: https://aim-uofa.github.io/GenDeF/