用于单幅图像去雾的视觉 Transformer
计算机视觉与模式识别
2023-04-12 v1
摘要
图像去雾是一种典型的底层视觉任务,从有雾图像估计潜在的无雾图像。近年来,基于卷积神经网络的方法主导了图像去雾。然而,近期在高层视觉任务中取得突破的视觉 Transformer(vision Transformers)尚未给图像去雾带来新的维度。我们从流行的 Swin Transformer 入手,发现其若干关键设计不适用于图像去雾。为此,我们提出了 DehazeFormer,它由多项改进组成,例如修改后的归一化层、激活函数以及空间信息聚合方案。我们在多个数据集上训练了 DehazeFormer 的多种变体以证明其有效性。具体而言,在最常用的 SOTS 室内集上,我们的小模型仅以 25% 的参数量和 5% 的计算成本便优于 FFA-Net。据我们所知,我们的大模型是首个在 SOTS 室内集上 PSNR 超过 40 dB 的方法,大幅优于先前的最先进(state-of-the-art)方法。我们还收集了一个大规模真实遥感去雾数据集,用于评估该方法去除高度非均匀雾的能力。
引用
@article{arxiv.2204.03883,
title = {Vision Transformers for Single Image Dehazing},
author = {Yuda Song and Zhuqing He and Hui Qian and Xin Du},
journal= {arXiv preprint arXiv:2204.03883},
year = {2023}
}