中文

一种用于视频预测的动态多尺度体素流网络

计算机视觉与模式识别 2023-03-27 v2

摘要

视频预测的性能已被先进的深度神经网络大幅提升。然而,当前大多数方法模型规模大,且需要额外输入(如语义/深度图)以取得理想性能。出于效率考虑,本文提出动态多尺度体素流网络(DMVFN),仅使用 RGB 图像即以比以往方法更低的计算成本实现更好的视频预测性能。我们 DMVFN 的核心是一个可微路由模块,能有效感知视频帧的运动尺度。一旦训练完成,我们的 DMVFN 在推理阶段为不同输入选择自适应子网络。在多个基准上的实验表明,我们的 DMVFN 比 Deep Voxel Flow 快一个数量级,并在生成图像质量上超越基于迭代的 SOTA 方法 OPT。我们的代码与演示见 https://huxiaotaostasy.github.io/DMVFN/。

关键词

引用

@article{arxiv.2303.09875,
  title  = {A Dynamic Multi-Scale Voxel Flow Network for Video Prediction},
  author = {Xiaotao Hu and Zhewei Huang and Ailin Huang and Jun Xu and Shuchang Zhou},
  journal= {arXiv preprint arXiv:2303.09875},
  year   = {2023}
}

备注

CVPR 2023