一种集成多模融合的实用门控循环Transformer网络用于视频去噪
计算机视觉与模式识别
2024-09-11 v1 图像与视频处理
摘要
现有最先进(SOTA)视频去噪方法采用多帧同步去噪机制,导致显著延迟(例如16帧),难以用于实时摄像机。为克服这一限制,我们提出一种多融合门控循环Transformer网络(GRTN),实现SOTA去噪性能且仅需单帧延迟。具体而言,空间去噪模块提取当前帧的特征,而复位门选择前一帧中相关信息并通过时序去噪模块与当前帧特征进行融合。更新门随后进一步将此结果与前一帧特征混合,重建模块则将其与当前帧集成。为稳健计算带噪特征的注意力,我们在空间和时序去噪模块中提出了一种基于欧几里得距离的残差简化Swin Transformer(RSSTE)。与主观和客观结果的比较表明,GRTN在仅单帧延迟下,达到了与SOTA多帧延迟网络相当的去噪性能。
引用
@article{arxiv.2409.06603,
title = {A Practical Gated Recurrent Transformer Network Incorporating Multiple Fusions for Video Denoising},
author = {Kai Guo and Seungwon Choi and Jongseong Choi and Lae-Hoon Kim},
journal= {arXiv preprint arXiv:2409.06603},
year = {2024}
}
备注
5 pages, 5 figures