中文

基于U-Net的GLOW用于无光流视频帧间生成

计算机视觉与模式识别 2021-06-30 v3 机器学习 图像与视频处理

摘要

视频帧插值是沿时间轴在两个相邻帧之间创建中间帧的任务。因此,该操作不应只是简单平均两个相邻帧来创建中间图像,而应维持与相邻帧的语义连续性。大多数传统方法使用光流,并且遮挡处理和对象平滑等各种工具必不可少。由于使用这些各种工具会导致复杂问题,我们试图在不使用有问题的光流的情况下解决视频帧间生成问题。为此,我们尝试使用具有可逆结构的深度神经网络,并开发了基于U-Net的生成流(Generative Flow),这是一种改进的标准化流(normalizing flow)。此外,我们提出了一种在潜空间中使用新一致性损失的学习方法,以维持帧间的语义时间一致性。通过使用可逆网络,生成图像的分辨率保证与原始图像相同。此外,由于它不像生成模型那样是随机图像,我们的网络保证稳定输出而无闪烁。通过实验,我们确认了所提算法的可行性,并建议将基于U-Net的生成流作为视频帧插值中基线的新可能。本文的意义在于它是世界上首次尝试使用可逆网络代替光流进行视频插值。

关键词

引用

@article{arxiv.2103.09576,
  title  = {The U-Net based GLOW for Optical-Flow-free Video Interframe Generation},
  author = {Saem Park and Donghoon Han and Nojun Kwak},
  journal= {arXiv preprint arXiv:2103.09576},
  year   = {2021}
}