中文

面向野外视频的级联视频生成

计算机视觉与模式识别 2022-06-03 v1 机器学习

摘要

视频可通过先勾勒场景全局视图再添加局部细节来创建。受此启发,我们提出一种遵循由粗到精方法的级联视频生成模型。我们的模型首先生成低分辨率视频以建立全局场景结构,随后由更高分辨率的级联层级细化。我们在视频的局部视图上依次训练每个级联层级,这降低了模型的计算复杂度,并使其可扩展至含多帧的高分辨率视频。我们在 UCF101 与 Kinetics-600 上实证验证了该方法,其模型与当前最优(SOTA)具竞争力。我们进一步展示了模型的扩展能力,并在 BDD100K 数据集上训练了三级模型,生成 256x256 像素、48 帧的视频。

关键词

引用

@article{arxiv.2206.00735,
  title  = {Cascaded Video Generation for Videos In-the-Wild},
  author = {Lluis Castrejon and Nicolas Ballas and Aaron Courville},
  journal= {arXiv preprint arXiv:2206.00735},
  year   = {2022}
}

备注

Accepted to the 26th International Conference on Pattern Recognition (ICPR 2022). arXiv admin note: substantial text overlap with arXiv:2106.02719