中文

利用光流引导的 Transformer 视频修复

计算机视觉与模式识别 2024-03-20 v2

摘要

由于多头自注意力(MHSA)机制,Transformer 已被广泛用于视频处理。然而,MHSA 机制在视频修复中面临固有困难,因为与损坏区域相关的特征发生退化并导致不准确的自注意力。这一问题被称为查询退化,可通过先补全光流再使用光流引导自注意力来缓解,这在我们先前的工作——光流引导 Transformer(FGT)中得到了验证。我们进一步利用光流引导,提出 FGT++ 以追求更有效且更高效的视频修复。首先,我们利用局部聚合与边缘损失设计了一个轻量级光流补全网络。其次,为解决查询退化,我们提出光流引导特征整合模块,利用运动差异增强特征,以及光流引导特征传播模块,根据光流对特征进行扭曲。第三,我们将 Transformer 沿时间与空间维度解耦,其中光流通过时间可变形 MHSA 机制用于选择令牌,全局令牌通过双视角 MHSA 机制与窗内局部令牌相结合。实验证明 FGT++ 在定性与定量上均优于现有视频修复网络。

关键词

引用

@article{arxiv.2301.10048,
  title  = {Exploiting Optical Flow Guidance for Transformer-Based Video Inpainting},
  author = {Kaidong Zhang and Jialun Peng and Jingjing Fu and Dong Liu},
  journal= {arXiv preprint arXiv:2301.10048},
  year   = {2024}
}

备注

Accepted to TPAMI. This manuscript is a journal extension of our ECCV 2022 paper (arXiv:2208.06768)