Super SloMo:用于视频插帧的多中间帧高质量估计
计算机视觉与模式识别
2018-07-16 v2
摘要
给定两帧连续图像,视频插帧旨在生成中间帧以形成空间和时间上均连贯的视频序列。虽然大多数现有方法关注单帧插帧,我们提出了一种用于变长度多帧视频插帧的端到端卷积神经网络,其中运动解释与遮挡推理被联合建模。我们首先使用 U-Net 架构计算输入图像间的双向光流。然后在每个时间步将这些光流线性组合以近似中间双向光流。然而,这些近似光流仅在局部平滑区域表现良好,并在运动边界附近产生伪影。为解决这一缺陷,我们采用另一个 U-Net 来细化近似光流并预测软可见性图。最后,两幅输入图像被扭曲并线性融合以形成每个中间帧。通过在融合前将可见性图应用于扭曲图像,我们排除了被遮挡像素对插值中间帧的贡献以避免伪影。由于我们所有学习的网络参数都不依赖于时间,我们的方法能够生成所需数量的中间帧。我们使用包含 30 万张独立视频帧的 1132 个 240-fps 视频片段来训练我们的网络。在多个数据集上预测不同数量插值帧的实验结果表明,我们的方法始终优于现有方法。
引用
@article{arxiv.1712.00080,
title = {Super SloMo: High Quality Estimation of Multiple Intermediate Frames for Video Interpolation},
author = {Huaizu Jiang and Deqing Sun and Varun Jampani and Ming-Hsuan Yang and Erik Learned-Miller and Jan Kautz},
journal= {arXiv preprint arXiv:1712.00080},
year = {2018}
}
备注
CVPR 2018 version with minor revisions and supplementary material included. Project page http://jianghz.me/projects/superslomo