基于双阶段空间-通道 Transformer 的由粗到细视频去噪
计算机视觉与模式识别
2023-01-18 v2
摘要
视频去噪旨在从含噪视频中恢复高质量帧。虽然大多数现有方法采用卷积神经网络(CNNs)将噪声与原始视觉内容分离,但 CNNs 关注局部信息而忽略帧内长距离区域间的交互。此外,多数相关工作直接将基础时空去噪后的输出作为最终结果,导致忽略了细粒度去噪过程。本文提出一种用于由粗到细视频去噪的双阶段空间-通道 Transformer(Dual-stage Spatial-Channel Transformer),其兼具 Transformer 与 CNNs 的优势。具体而言,DSCT 基于渐进式双阶段架构提出,即粗粒度阶段与细粒度阶段,分别用于提取动态特征与静态特征。在两阶段中,设计空间-通道编码模块以在空间和通道层面建模长距离上下文依赖。同时,我们设计多尺度残差结构以在不同阶段保留多方面信息,其中包含时序特征聚合模块以汇总动态表示。在四个公开数据集上的大量实验表明,我们所提方法相比 SOTA 方法取得了显著改进。
引用
@article{arxiv.2205.00214,
title = {Coarse-to-Fine Video Denoising with Dual-Stage Spatial-Channel Transformer},
author = {Wulian Yun and Mengshi Qi and Chuanming Wang and Huiyuan Fu and Huadong Ma},
journal= {arXiv preprint arXiv:2205.00214},
year = {2023}
}