中文

面向真实场景事件驱动视频插帧与自适应去模糊的统一框架

计算机视觉与模式识别 2025-05-21 v3

摘要

有效的视频帧插值依赖于对输入场景中运动的熟练处理。先前的工作利用异步事件信息来实现这一目标,但往往忽略了运动是否会在视频中引起模糊,从而将其范围限制在清晰帧插值上。我们提出了一种统一的基于事件的帧插值框架,该框架可自适应地执行去模糊,因此适用于清晰和模糊的输入视频。我们的模型由一个双向循环网络组成,该网络融合了插值的时间维度,并根据输入帧和事件的时间接近度自适应地融合信息。为了增强从合成数据到真实事件相机的泛化能力,我们将自监督框架与所提出的模型相结合,以增强在真实世界数据集上的泛化能力。在数据集层面,我们引入了一个名为HighREV的新型真实世界高分辨率数据集,其中包含事件和彩色视频,为所研究的任务提供了一个具有挑战性的评估环境。大量实验表明,我们的网络在帧插值、单图像去模糊以及两者的联合任务上始终优于先前的最先进方法。域迁移实验表明,自监督训练有效缓解了从合成数据过渡到真实世界数据时观察到的性能下降。代码和数据集可在https://github.com/AHupuJR/REFID获取。

关键词

引用

@article{arxiv.2301.05191,
  title  = {A Unified Framework for Event-based Frame Interpolation with Ad-hoc Deblurring in the Wild},
  author = {Lei Sun and Daniel Gehrig and Christos Sakaridis and Mathias Gehrig and Jingyun Liang and Peng Sun and Zhijie Xu and Kaiwei Wang and Luc Van Gool and Davide Scaramuzza},
  journal= {arXiv preprint arXiv:2301.05191},
  year   = {2025}
}

备注

Accepted to T-PAMI