面向视频修复的缺陷感知掩码 Transformer
计算机视觉与模式识别
2023-07-18 v1
摘要
近期视频修复方法借助光流等显式引导来传播跨帧像素,取得了显著进展。然而,存在被掩码视频的跨帧循环不可用从而导致缺陷的情形。在此情况下,模型的重点由从其他帧借用像素转向解决逆问题。本文提出一种双模态兼容的修复框架,称为缺陷感知掩码 Transformer (DMT),其具有三个关键优势。首先,我们预训练图像修复模型 DMT_img 作为蒸馏视频模型 DMT_vid 的先验,从而有益于缺陷情形的幻觉生成。其次,自注意力模块选择性地纳入时空 token 以加速推理并去除噪声信号。第三,一个简洁而有效的感受野上下文化模块被集成到 DMT 中,进一步提升性能。在 YouTube-VOS 与 DAVIS 数据集上的大量实验表明 DMT_vid 显著优于先前方案。代码与视频演示见 github.com/yeates/DMT。
引用
@article{arxiv.2307.08629,
title = {Deficiency-Aware Masked Transformer for Video Inpainting},
author = {Yongsheng Yu and Heng Fan and Libo Zhang},
journal= {arXiv preprint arXiv:2307.08629},
year = {2023}
}