从注意力到频率:集成 Vision Transformer 与 FFT-ReLU 以提升图像去模糊
图像与视频处理
2025-11-17 v1 计算机视觉与模式识别
摘要
图像去模糊是计算机视觉中的关键任务,旨在从由运动或相机抖动引起的模糊图像中恢复清晰图像。虽然 CNN 和 Vision Transformer(ViT)等深度学习方法已在该领域取得进展,但它们往往在处理复杂或高分辨率模糊以及计算需求方面存在挑战。我们提出了一种新的双域架构,将 Vision Transformer 与频域 FFT-ReLU 模块集成在一起,显式地桥接空间注意力建模与频域稀疏性。在此结构中,ViT 主干网络捕获局部和全局依赖关系,而 FFT-ReLU 组件强制执行频域稀疏,以抑制与模糊相关的伪影并保留细节。在基准数据集上的广泛实验表明,该架构在 PSNR、SSIM 和感知质量方面均优于最先进的模型。定量指标、定性比较和人类偏好评估均证明其有效性,确立了一种实用且可推广的图像修复范式。
引用
@article{arxiv.2511.10806,
title = {From Attention to Frequency: Integration of Vision Transformer and FFT-ReLU for Enhanced Image Deblurring},
author = {Syed Mumtahin Mahmud and Mahdi Mohd Hossain Noki and Prothito Shovon Majumder and Abdul Mohaimen Al Radi and Md. Haider Ali and Md. Mosaddek Khan},
journal= {arXiv preprint arXiv:2511.10806},
year = {2025}
}