RViDeformer:具有更大基准数据集的高效原始视频去噪Transformer
计算机视觉与模式识别
2025-03-18 v2 机器学习
摘要
近年来,原始视频去噪因与成像过程一致且在原始域具有成熟研究的噪声建模而受到更多关注。然而,两个问题仍阻碍去噪性能。首先,缺乏具有真实运动的大规模监督原始视频去噪数据集,因为捕捉真实动态场景的噪声与干净帧十分困难。为此,我们提出将现有高分辨率视频以高低ISO设置在4K屏幕上重新播放采集,以构建噪声-干净配对帧。以此方式,我们构建了含120组噪声-干净视频的去噪数据集(命名为ReCRVD),其ISO值介于1600至25600。其次,虽非局部时空注意力有益于去噪,却常导致沉重计算开销。我们提出高效原始视频去噪Transformer网络(RViDeformer),探索短距与长距相关性。具体而言,我们提出多分支空间与时间注意力模块,从局部窗口、局部低分辨率窗口、全局下采样窗口及邻域参与窗口探索块相关性,随后融合。我们采用重参数化以降低计算成本。我们的网络以监督与无监督两种方式训练,相较SOTA方法取得最佳性能。此外,在我们提出的数据集(ReCRVD)上训练的模型,在真实世界室外噪声视频评估中优于在先前基准数据集(CRVD)上训练的模型。我们的代码与数据集见于 https://github.com/cao-cong/RViDeformer。
引用
@article{arxiv.2305.00767,
title = {RViDeformer: Efficient Raw Video Denoising Transformer with a Larger Benchmark Dataset},
author = {Huanjing Yue and Cong Cao and Lei Liao and Jingyu Yang},
journal= {arXiv preprint arXiv:2305.00767},
year = {2025}
}
备注
Accepted by TCSVT 2025