中文

基于 Transformer 的视频帧插值

计算机视觉与模式识别 2022-05-17 v1

摘要

视频帧插值(VFI)旨在合成视频的中间帧,随着深度卷积网络的发展在过去几年取得了显著进展。基于卷积网络的现有方法由于卷积操作的局部性,通常面临处理大运动的挑战。为克服此限制,我们引入了一种新颖框架,利用 Transformer 建模视频帧间的长程像素相关性。此外,我们的网络配备了一种新颖的跨尺度基于窗口的注意力机制,其中跨尺度窗口相互交互。该设计有效扩大了感受野并聚合了多尺度信息。大量定量与定性实验表明,我们的方法在各种基准上取得了新的 SOTA 结果。

关键词

引用

@article{arxiv.2205.07230,
  title  = {Video Frame Interpolation with Transformer},
  author = {Liying Lu and Ruizheng Wu and Huaijia Lin and Jiangbo Lu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2205.07230},
  year   = {2022}
}

备注

CVPR2022