中文

用于视频插值的跨注意力Transformer

计算机视觉与模式识别 2022-12-05 v2

摘要

我们提出了TAIN(Transformers and Attention for video INterpolation,用于视频插值的Transformer与注意力),一种用于视频插值的残差神经网络,旨在给定其前后两帧连续图像帧的情况下插值出中间帧。我们首先提出一个名为交叉相似性(CS)的新型视觉Transformer模块,用于全局聚合与预测插值帧外观相似的图像特征。这些CS特征随后被用于细化插值预测。为处理CS特征中的遮挡问题,我们提出图像注意力(IA)模块,使网络能够聚焦于来自某一帧的CS特征而非另一帧。TAIN在不需要光流估计的方法中表现最优,并与基于光流的方法性能相当,同时在Vimeo90k、UCF101和SNU-FILM基准上推理时间计算高效。

关键词

引用

@article{arxiv.2207.04132,
  title  = {Cross-Attention Transformer for Video Interpolation},
  author = {Hannah Halin Kim and Shuzhi Yu and Shuai Yuan and Carlo Tomasi},
  journal= {arXiv preprint arXiv:2207.04132},
  year   = {2022}
}