用于视频插值的跨注意力Transformer
计算机视觉与模式识别
2022-12-05 v2
摘要
我们提出了TAIN(Transformers and Attention for video INterpolation,用于视频插值的Transformer与注意力),一种用于视频插值的残差神经网络,旨在给定其前后两帧连续图像帧的情况下插值出中间帧。我们首先提出一个名为交叉相似性(CS)的新型视觉Transformer模块,用于全局聚合与预测插值帧外观相似的图像特征。这些CS特征随后被用于细化插值预测。为处理CS特征中的遮挡问题,我们提出图像注意力(IA)模块,使网络能够聚焦于来自某一帧的CS特征而非另一帧。TAIN在不需要光流估计的方法中表现最优,并与基于光流的方法性能相当,同时在Vimeo90k、UCF101和SNU-FILM基准上推理时间计算高效。
引用
@article{arxiv.2207.04132,
title = {Cross-Attention Transformer for Video Interpolation},
author = {Hannah Halin Kim and Shuzhi Yu and Shuai Yuan and Carlo Tomasi},
journal= {arXiv preprint arXiv:2207.04132},
year = {2022}
}