中文

Super SloMo:用于视频插帧的多中间帧高质量估计

计算机视觉与模式识别 2018-07-16 v2

摘要

给定两帧连续图像,视频插帧旨在生成中间帧以形成空间和时间上均连贯的视频序列。虽然大多数现有方法关注单帧插帧,我们提出了一种用于变长度多帧视频插帧的端到端卷积神经网络,其中运动解释与遮挡推理被联合建模。我们首先使用 U-Net 架构计算输入图像间的双向光流。然后在每个时间步将这些光流线性组合以近似中间双向光流。然而,这些近似光流仅在局部平滑区域表现良好,并在运动边界附近产生伪影。为解决这一缺陷,我们采用另一个 U-Net 来细化近似光流并预测软可见性图。最后,两幅输入图像被扭曲并线性融合以形成每个中间帧。通过在融合前将可见性图应用于扭曲图像,我们排除了被遮挡像素对插值中间帧的贡献以避免伪影。由于我们所有学习的网络参数都不依赖于时间,我们的方法能够生成所需数量的中间帧。我们使用包含 30 万张独立视频帧的 1132 个 240-fps 视频片段来训练我们的网络。在多个数据集上预测不同数量插值帧的实验结果表明,我们的方法始终优于现有方法。

关键词

引用

@article{arxiv.1712.00080,
  title  = {Super SloMo: High Quality Estimation of Multiple Intermediate Frames for Video Interpolation},
  author = {Huaizu Jiang and Deqing Sun and Varun Jampani and Ming-Hsuan Yang and Erik Learned-Miller and Jan Kautz},
  journal= {arXiv preprint arXiv:1712.00080},
  year   = {2018}
}

备注

CVPR 2018 version with minor revisions and supplementary material included. Project page http://jianghz.me/projects/superslomo