通过学习多层 2.5D 运动场实现无监督视频插值
计算机视觉与模式识别
2022-04-22 v1
摘要
视频帧插值的问题是通过在已有的时间稀疏帧之间插值新帧,来提高低帧率视频的时间分辨率。本文提出一种仅需单个视频的自监督视频帧插值方法。我们将视频表示为一组图层,每个图层由两个隐式神经网络参数化——一个用于学习静态帧,另一个用于对应视频动态的时变运动场。二者共同表示一个带伪深度通道的无遮挡场景子集。为建模层间遮挡,所有图层被提升到 2.5D 空间,使前景图层遮挡远处图层。这是通过为每个图层分配一个深度通道(我们称之为“伪深度”)来实现的,其偏序定义了图层间的遮挡关系。伪深度通过完全可微的 SoftMin 函数转换为可见性值,使较近图层比较远图层更可见。另一方面,我们通过求解定义于时变神经速度场上的常微分方程(ODE)来参数化视频运动,该方程保证运动有效。这种隐式神经表示将视频学习为时空连续体,允许以任意时间分辨率进行帧插值。我们在真实数据集上展示了方法的有效性,其性能可与需要真值标签训练的当前最优方法相媲美。
引用
@article{arxiv.2204.09900,
title = {Unsupervised Video Interpolation by Learning Multilayered 2.5D Motion Fields},
author = {Ziang Cheng and Shihao Jiang and Hongdong Li},
journal= {arXiv preprint arXiv:2204.09900},
year = {2022}
}