增强型二次视频插值
计算机视觉与模式识别
2020-09-11 v1
摘要
随着数字视频产业的繁荣,视频帧插值在计算机视觉界引起了持续关注,并成为产业界的新热潮。许多基于学习的方法被提出并取得了渐进式成果。其中,近期一种名为二次视频插值(QVI)的算法取得了引人注目的性能。它利用高阶运动信息(如加速度)并成功建模了插值光流的估计。然而,其所生成的中间帧仍包含一些不理想的重影、伪影及不准确运动,尤其在发生大幅且复杂运动时。在本工作中,我们从三个方面进一步提升 QVI 的性能,并提出一种增强型二次视频插值(EQVI)模型。具体而言,我们采用带最小二乘法的修正二次流预测(RQFP)公式以更准确地估计运动。作为图像像素级混合的补充,我们引入残差上下文合成网络(RCSN)以在高维特征空间中利用上下文信息,这有助于模型处理更复杂的场景与运动模式。此外,为进一步提振性能,我们设计了一种新颖的多尺度融合网络(MS-Fusion),其可被视为可学习的增强过程。所提出的 EQVI 模型在 AIM2020 视频时间超分辨率挑战赛中荣获第一名。
引用
@article{arxiv.2009.04642,
title = {Enhanced Quadratic Video Interpolation},
author = {Yihao Liu and Liangbin Xie and Li Siyao and Wenxiu Sun and Yu Qiao and Chao Dong},
journal= {arXiv preprint arXiv:2009.04642},
year = {2020}
}
备注
Winning solution of AIM2020 VTSR Challenge (in conjunction with ECCV 2020)