面向野外视频的级联视频生成
计算机视觉与模式识别
2022-06-03 v1 机器学习
摘要
视频可通过先勾勒场景全局视图再添加局部细节来创建。受此启发,我们提出一种遵循由粗到精方法的级联视频生成模型。我们的模型首先生成低分辨率视频以建立全局场景结构,随后由更高分辨率的级联层级细化。我们在视频的局部视图上依次训练每个级联层级,这降低了模型的计算复杂度,并使其可扩展至含多帧的高分辨率视频。我们在 UCF101 与 Kinetics-600 上实证验证了该方法,其模型与当前最优(SOTA)具竞争力。我们进一步展示了模型的扩展能力,并在 BDD100K 数据集上训练了三级模型,生成 256x256 像素、48 帧的视频。
引用
@article{arxiv.2206.00735,
title = {Cascaded Video Generation for Videos In-the-Wild},
author = {Lluis Castrejon and Nicolas Ballas and Aaron Courville},
journal= {arXiv preprint arXiv:2206.00735},
year = {2022}
}
备注
Accepted to the 26th International Conference on Pattern Recognition (ICPR 2022). arXiv admin note: substantial text overlap with arXiv:2106.02719