DeblurDiNAT:在未见域上具有出色泛化能力与视觉保真度的紧凑模型
计算机视觉与模式识别
2025-01-16 v5
摘要
最近的去模糊网络已能有效从模糊图像中恢复清晰图像。然而,它们在向未知领域泛化时常常遇到困难。此外,这些模型通常关注诸如 PSNR 和 SSIM 等失真指标,而忽视了与人类感知对齐的指标这一关键方面。为了解决这些局限性,我们提出了 DeblurDiNAT,一种基于膨胀邻域注意力的去模糊 Transformer。首先,DeblurDiNAT 采用交替膨胀因子范式来捕获局部和全局模糊模式,从而增强泛化能力和感知清晰度。其次,局部的跨通道学习器帮助 Transformer 块理解相邻通道间的短程关系。此外,我们提出了一个设计简单而有效的线性前馈网络。最后,引入了双阶段特征融合模块作为现有方法的替代方案,该模块能高效处理跨网络层级的多种尺度视觉信息。与 SOTA 模型相比,我们紧凑的 DeblurDiNAT 展现了卓越的泛化能力,并在感知指标上取得了显著性能,同时保持了适宜的模型大小。
引用
@article{arxiv.2403.13163,
title = {DeblurDiNAT: A Compact Model with Exceptional Generalization and Visual Fidelity on Unseen Domains},
author = {Hanzhou Liu and Binghan Li and Chengkai Liu and Mi Lu},
journal= {arXiv preprint arXiv:2403.13163},
year = {2025}
}