PDWN:用于视频插值的金字塔可变形扭曲网络
计算机视觉与模式识别
2021-04-06 v1
摘要
视频插值旨在给定过去与未来帧的情况下生成不存在的中间帧。许多最先进的方法通过估计已知帧之间的光流,然后生成中间帧与已知帧之间的后向流,取得了有前景的结果。然而,这些方法通常受限于估计光流的不准确性,并需要额外的模型或信息来补偿流估计误差。跟随近期使用可变形卷积(DConv)进行视频插值的发展,我们提出了一种轻量但有效的模型,称为金字塔可变形扭曲网络(PDWN)。PDWN 使用金字塔结构,通过由粗到细的连续细化,生成未知中间帧相对于已知帧的 DConv 偏移量。在每一个金字塔层级计算扭曲特征之间的代价体积以辅助偏移推断。在最精细尺度上,两帧扭曲帧被自适应混合以生成中间帧。最后,上下文增强网络进一步增强最终输出的上下文细节。消融研究证明了由粗到细偏移细化、代价体积与 DConv 的有效性。我们的方法在多个数据集上取得了优于或与最先进模型相当的精度,而模型参数量与推理时间显著少于先前模型。此外,我们给出了所提框架使用四输入帧的扩展,其相比仅用两输入帧能取得显著提升,且模型规模与推理时间仅轻微增加。
引用
@article{arxiv.2104.01517,
title = {PDWN: Pyramid Deformable Warping Network for Video Interpolation},
author = {Zhiqi Chen and Ran Wang and Haojie Liu and Yao Wang},
journal= {arXiv preprint arXiv:2104.01517},
year = {2021}
}