基于多尺度深度损失函数与生成对抗网络的帧插值
计算机视觉与模式识别
2019-02-27 v2
摘要
帧插值旨在给定一个或多个连续视频帧的情况下合成中间帧。近年来,深度学习方法,尤其是卷积神经网络,已成功解决包括帧插值在内的低层与高层计算机视觉问题。这些技术通常处理两个问题,即算法效率与重建质量。在本文中,我们提出一种用于帧插值的多尺度生成对抗网络(\mbox{FIGAN})。为最大化网络效率,我们提出一种新颖的多尺度残差估计模块,其中预测的流与合成的帧以由粗到细的方式构建。为提升合成中间视频帧的质量,我们的网络在不同层级以由对抗损失与两个内容损失组成的感知损失函数进行联合监督。我们使用来自 YouTube-8m 的一组 60fps 视频评估所提方法。我们的结果改进了当前最优(SOTA)精度,并提供了与性能最佳插值方法相当的主观视觉质量,而运行时间快 47 倍。
引用
@article{arxiv.1711.06045,
title = {Frame Interpolation with Multi-Scale Deep Loss Functions and Generative Adversarial Networks},
author = {Joost van Amersfoort and Wenzhe Shi and Alejandro Acosta and Francisco Massa and Johannes Totz and Zehan Wang and Jose Caballero},
journal= {arXiv preprint arXiv:1711.06045},
year = {2019}
}