基于 Transformer 的视频帧插值
计算机视觉与模式识别
2022-05-17 v1
摘要
视频帧插值(VFI)旨在合成视频的中间帧,随着深度卷积网络的发展在过去几年取得了显著进展。基于卷积网络的现有方法由于卷积操作的局部性,通常面临处理大运动的挑战。为克服此限制,我们引入了一种新颖框架,利用 Transformer 建模视频帧间的长程像素相关性。此外,我们的网络配备了一种新颖的跨尺度基于窗口的注意力机制,其中跨尺度窗口相互交互。该设计有效扩大了感受野并聚合了多尺度信息。大量定量与定性实验表明,我们的方法在各种基准上取得了新的 SOTA 结果。
关键词
引用
@article{arxiv.2205.07230,
title = {Video Frame Interpolation with Transformer},
author = {Liying Lu and Ruizheng Wu and Huaijia Lin and Jiangbo Lu and Jiaya Jia},
journal= {arXiv preprint arXiv:2205.07230},
year = {2022}
}
备注
CVPR2022