用于深度视频修复的可学习门控时序移位模块
计算机视觉与模式识别
2025-05-14 v2
摘要
如何高效利用时序信息以一致的方式恢复视频是视频修复问题的核心。常规 2D CNN 在图像修复上已取得良好性能,但用于视频时常导致时序不一致的结果,即帧闪烁(见 https://www.youtube.com/watch?v=87Vh1HDBjD0&list=PLPoVtv-xp_dL5uckIzz1PKwNjg1yI0I94&index=1);3D CNN 能捕捉时序信息但计算密集且难以训练。本文提出一种用于视频修复模型的新型组件——可学习门控时序移位模块(LGTSM),它无需 3D 卷积的额外参数即可有效处理任意视频掩码。LGTSM 旨在让 2D 卷积更高效地利用于邻帧,这对视频修复至关重要。具体而言,在每一层中,LGTSM 学习将部分通道移位至其时序邻帧,从而增强 2D 卷积处理时序信息的能力。同时,对该层施加门控卷积以识别对常规卷积有损害的掩码区域。在 FaceForensics 与自由形式视频修复(FVI)数据集上,我们的模型仅以 33% 的参数与推理时间取得了最先进(SOTA)结果。
引用
@article{arxiv.1907.01131,
title = {Learnable Gated Temporal Shift Module for Deep Video Inpainting},
author = {Ya-Liang Chang and Zhe Yu Liu and Kuan-Ying Lee and Winston Hsu},
journal= {arXiv preprint arXiv:1907.01131},
year = {2025}
}
备注
Accepted to BMVC 2019