用于视频修复的流引导 Transformer
计算机视觉与模式识别
2022-08-16 v1
摘要
我们提出一种流引导 Transformer,其创新性地利用光流所揭示的运动差异来指导 Transformer 中的注意力检索,以实现高保真视频修复。更具体地,我们设计了一种新颖的流补全网络,通过在局部时间窗中利用相关流特征来补全损坏的光流。借助补全后的光流,我们跨视频帧传播内容,并采用流引导 Transformer 合成其余损坏区域。我们沿时间与空间维度解耦 Transformer,从而可轻松集成局部相关的补全光流以仅指导空间注意力。此外,我们设计了一个流重加权模块,以精确控制补全光流对各空间 Transformer 的影响。为提升效率,我们对空间与时间 Transformer 均引入窗口划分策略。尤其在空间 Transformer 中,我们设计了双视角空间 MHSA,将全局 token 集成到基于窗口的注意力中。大量实验从定性与定量上证明了所提方法的有效性。代码见 https://github.com/hitachinsk/FGT。
引用
@article{arxiv.2208.06768,
title = {Flow-Guided Transformer for Video Inpainting},
author = {Kaidong Zhang and Jingjing Fu and Dong Liu},
journal= {arXiv preprint arXiv:2208.06768},
year = {2022}
}
备注
ECCV 2022