中文

从此到彼:使用直接三维卷积的视频中间帧生成

计算机视觉与模式识别 2019-06-05 v3 人工智能 机器学习

摘要

我们考虑在仅给定起始帧和结束帧的情况下生成合理且多样的视频序列的问题。该任务也称为中间帧生成(inbetweening),属于更广泛的随机视频生成领域,通常借助循环神经网络(RNN)来处理。本文中,我们转而提出一种全卷积模型,直接在像素域中生成视频序列。我们首先使用随机融合机制获得潜视频表示,该机制学习如何融入起始帧和结束帧的信息。我们的模型通过学习逐步提升时间分辨率来产生此类潜表示,随后使用三维卷积在时空域中解码。该模型通过最小化对抗损失进行端到端训练。在多个广泛使用的基准数据集上的实验表明,根据定量与定性评估,它能够生成有意义且多样的中间视频序列。

关键词

引用

@article{arxiv.1905.10240,
  title  = {From Here to There: Video Inbetweening Using Direct 3D Convolutions},
  author = {Yunpeng Li and Dominik Roblek and Marco Tagliasacchi},
  journal= {arXiv preprint arXiv:1905.10240},
  year   = {2019}
}