中文

面向连续条件视频预测的统一模型

计算机视觉与模式识别 2023-04-10 v2

摘要

不同的条件视频预测任务,如视频未来帧预测与视频帧插值,尽管共享许多共同的底层特征,通常仍由任务相关模型分别求解。此外,几乎所有条件视频预测模型只能实现离散预测。本文中,我们提出一个统一模型,同时解决这两个问题。我们表明条件视频预测可表述为神经过程,其在给定上下文时空坐标与上下文像素值的情况下,将输入时空坐标映射到目标像素值。具体而言,我们将坐标与上下文像素特征的隐式神经表示输入基于 Transformer 的非自回归条件视频预测模型。我们的任务特定模型在多个数据集上的视频未来帧预测与视频插值均优于先前工作。重要的是,该模型能够以任意高帧率进行插值或预测,即连续预测。我们的源代码见 \url{https://npvp.github.io}。

关键词

引用

@article{arxiv.2210.05810,
  title  = {A unified model for continuous conditional video prediction},
  author = {Xi Ye and Guillaume-Alexandre Bilodeau},
  journal= {arXiv preprint arXiv:2210.05810},
  year   = {2023}
}

备注

Accepted by CVPR2023 Workshop