TTVFI:面向视频帧插值的轨迹感知Transformer学习
计算机视觉与模式识别
2022-07-20 v1
摘要
视频帧插值(VFI)旨在合成两连续帧之间的中间帧。最先进的方法通常采用两步方案,包括:1)通过基于光流的运动估计生成局部扭曲像素,2)通过深度神经合成网络混合扭曲像素以形成完整帧。然而,由于两连续帧的扭曲不一致,新帧的扭曲特征通常未对齐,这导致失真和模糊的帧,尤其在发生大而复杂运动时。为解决此问题,本文提出一种新颖的面向视频帧插值的轨迹感知Transformer(TTVFI)。特别地,我们将具有不一致运动的扭曲特征表示为查询令牌(query tokens),并将两原始连续帧运动轨迹中的相关区域表示为键(keys)和值(values)。沿轨迹在相关令牌上学习自注意力,通过端到端训练将原始特征混合到中间帧中。实验结果表明,我们的方法在四个广泛使用的VFI基准上优于其他最先进方法。代码与预训练模型将很快发布。
引用
@article{arxiv.2207.09048,
title = {TTVFI: Learning Trajectory-Aware Transformer for Video Frame Interpolation},
author = {Chengxu Liu and Huan Yang and Jianlong Fu and Xueming Qian},
journal= {arXiv preprint arXiv:2207.09048},
year = {2022}
}