中文

视频帧插值 Transformer

计算机视觉与模式识别 2022-03-29 v3

摘要

现有的视频插值方法严重依赖深度卷积神经网络,因此受其固有局限性的影响,如与内容无关的内核权重和受限的感受野。为解决这些问题,我们提出了一种基于 Transformer 的视频插值框架,该框架允许内容感知的聚合权重,并通过自注意力操作考虑长距离依赖。为避免全局自注意力的高计算成本,我们将局部注意力的概念引入视频插值并将其扩展到时空域。此外,我们提出一种时空分离策略以节省内存占用,同时也提升了性能。另外,我们开发了多尺度帧合成方案以充分释放 Transformer 的潜力。大量实验表明,所提模型在多个基准数据集上定量与定性均优于 SOTA 方法。

关键词

引用

@article{arxiv.2111.13817,
  title  = {Video Frame Interpolation Transformer},
  author = {Zhihao Shi and Xiangyu Xu and Xiaohong Liu and Jun Chen and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2111.13817},
  year   = {2022}
}