中文

DeViT:视频修复中形变视觉 Transformer

计算机视觉与模式识别 2022-09-29 v1

摘要

本文提出一种新颖的视频修复方法。我们做出三项主要贡献:首先,我们通过引入形变基于块的单应变换(DePtH)扩展了先前的带块对齐的 Transformer,其在无需额外监督的情况下改善块级特征对齐,并有益于具有各种形变的困难场景。其次,我们引入基于掩码剪枝的块注意力(MPPA),通过剪除较不重要的特征并使用显著图来改善块级特征匹配。MPPA 增强了带无效像素的扭曲令牌之间的匹配精度。第三,我们引入空间—时间加权适配器(STA)模块,在由 DePtH 学到的形变因子引导下获得对空间—时间令牌的准确注意力,尤其针对具有敏捷运动的视频。实验结果表明,我们的方法在定性与定量上均优于近期方法,并达到了新的 SOTA。

关键词

引用

@article{arxiv.2209.13925,
  title  = {DeViT: Deformed Vision Transformers in Video Inpainting},
  author = {Jiayin Cai and Changlin Li and Xin Tao and Chun Yuan and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:2209.13925},
  year   = {2022}
}