基于流Transformer的视频帧插值
计算机视觉与模式识别
2023-08-01 v1 多媒体
摘要
随着卷积神经网络的发展,视频帧插值得到了积极研究。然而,由于卷积中核权重共享的固有局限性,由其生成的插值帧可能会丢失细节。相比之下,Transformer中的注意力机制能够更好地区分每个像素的贡献,并且还能捕捉长程像素依赖关系,这为视频插值提供了巨大潜力。尽管如此,原始Transformer通常用于2D图像;如何开发一个考虑时间自注意力的基于Transformer的框架用于视频帧插值仍是一个开放问题。在本文中,我们提出视频帧插值流Transformer(Video Frame Interpolation Flow Transformer),将光流的运动动态融入自注意力机制中。具体而言,我们设计了一个流Transformer块(Flow Transformer Block),在流的引导下于匹配局部区域计算时间自注意力,使我们的框架适用于具有大运动的帧插值,同时保持合理较低的复杂度。此外,我们构建了多尺度架构以考虑多尺度运动,进一步提升了整体性能。在三个基准上的大量实验表明,所提方法能够生成比最先进方法具有更好视觉质量的插值帧。
引用
@article{arxiv.2307.16144,
title = {Video Frame Interpolation with Flow Transformer},
author = {Pan Gao and Haoyue Tian and Jie Qin},
journal= {arXiv preprint arXiv:2307.16144},
year = {2023}
}
备注
Accepted to ACM MM23