探索视频帧插值的间断性
计算机视觉与模式识别
2023-03-24 v5
摘要
视频帧插值(VFI)是给定两帧连续帧合成中间帧的任务。以往大多数研究集中于适当的帧扭曲操作以及对扭曲帧的细化模块。这些研究是在仅包含连续运动的自然视频上进行的。然而,许多实际视频包含带有间断运动(如标志、用户界面和字幕)的各种非自然物体。我们提出三种技术使现有的基于深度学习的 VFI 架构对这些元素具有鲁棒性。其一是称为图文混合(FTM)的新型数据增强策略,可使模型在训练阶段无需任何额外数据集即可学习间断运动。其次,我们提出一个简单但有效的模块,预测称为间断图(D-map)的图,其密集区分连续与间断运动区域。最后,我们提出损失函数以对间断运动区域提供监督,可配合 FTM 和 D-map 使用。我们额外收集了一个称为图形间断运动(GDM)数据集的特殊测试基准,由一些手机游戏和聊天视频组成。应用于各种最先进的 VFI 网络,我们的方法显著提升了不仅在 GDM 数据集上,也在 Vimeo90K、UCF101 和 DAVIS 等仅含连续运动的现有基准上的插值质量。
引用
@article{arxiv.2202.07291,
title = {Exploring Discontinuity for Video Frame Interpolation},
author = {Sangjin Lee and Hyeongmin Lee and Chajin Shin and Hanbin Son and Sangyoun Lee},
journal= {arXiv preprint arXiv:2202.07291},
year = {2023}
}
备注
highlight at CVPR 2023 (10% of accepted papers)