用于视频修复的解耦时空 Transformer
计算机视觉与模式识别
2021-04-15 v1
摘要
视频修复旨在以逼真外观填补给定的时空孔洞,但即便借助兴盛的深度学习手段仍具挑战。近期工作将前景广阔的 Transformer 架构引入深度视频修复并取得更优性能。然而,其仍受合成模糊纹理及巨大计算开销的困扰。为此,我们提出一种新颖的解耦时空 Transformer(DSTT),以卓越效率改进视频修复。我们所提 DSTT 将学习时空注意力的任务解耦为两个子任务:其一是在相同空间位置不同帧上关注时序物体运动,由时间解耦 Transformer 块实现;其二是于同帧所有空间位置关注相似背景纹理,由空间解耦 Transformer 块实现。两类块的交织堆叠使模型更精准地关注背景纹理与运动物体,从而可将合理的、时间相干的表象传播以填补孔洞。此外,在 Transformer 块堆叠前采用分层编码器,学习保持多级局部空间结构的鲁棒分层特征,得到更具代表性的 token 向量。这两类新颖设计的无缝结合形成了更优的时空注意力方案,我们所提模型以显著提升的效率超越了最先进的(SOTA)视频修复方法。
引用
@article{arxiv.2104.06637,
title = {Decoupled Spatial-Temporal Transformer for Video Inpainting},
author = {Rui Liu and Hanming Deng and Yangyi Huang and Xiaoyu Shi and Lewei Lu and Wenxiu Sun and Xiaogang Wang and Jifeng Dai and Hongsheng Li},
journal= {arXiv preprint arXiv:2104.06637},
year = {2021}
}