中文

E-VFIA:基于事件且带注意力机制的视频帧插值

计算机视觉与模式识别 2023-03-02 v3

摘要

视频帧插值(VFI)是一项基础视觉任务,旨在合成两幅连续原始视频图像之间的若干帧。大多数算法仅利用关键帧来完成VFI,这是一个病态问题,因为关键帧通常无法提供场景中物体轨迹的准确信息。另一方面,基于事件的相机在视频关键帧之间提供了更精确的信息。一些近期最先进的基于事件的方法通过利用事件数据以更好地估计光流并通过扭曲来插值视频帧来处理该问题。然而,这些方法严重受到重影效应的影响。另一方面,一些仅以帧作为输入基于核的VFI方法已表明,当由transformers支持时,可变形卷积可作为处理长程依赖的可靠方式。我们提出基于事件且带注意力机制的视频帧插值(E-VFIA),作为一种轻量级基于核的方法。E-VFIA通过可变形卷积将事件信息与平面视频帧融合以生成高质量插值帧。所提方法以高时间分辨率表示事件,并使用多头自注意力机制以更好地编码基于事件的信息,同时较不易受模糊和重影伪影影响;从而生成更清晰的帧。仿真结果表明,所提技术在显著更小模型尺寸下优于当前最先进方法(基于帧和基于事件的)。

关键词

引用

@article{arxiv.2209.09359,
  title  = {E-VFIA : Event-Based Video Frame Interpolation with Attention},
  author = {Onur Selim Kılıç and Ahmet Akman and A. Aydın Alatan},
  journal= {arXiv preprint arXiv:2209.09359},
  year   = {2023}
}

备注

Accepted to 2023 IEEE International Conference on Robotics and Automation (ICRA 2023)