面向通用图像复原的联合多维动态注意力与Transformer
计算机视觉与模式识别
2025-11-27 v2
摘要
户外图像经常因雨、雾和噪声而严重退化,损害图像质量并给高级任务带来挑战。当前的图像复原方法难以在保持效率的同时处理复杂退化。本文介绍了一种新颖的图像复原架构,该架构在U-Net框架内结合了多维动态注意力和自注意力。为了利用Transformer的全局建模能力和卷积的局部建模能力,我们在编码器-解码器中仅集成CNN,在潜在层中仅集成Transformer。此外,我们设计了具有选择性多维动态注意力的卷积核,以高效捕获多样化的退化输入。具有转置自注意力的Transformer块进一步增强了全局特征提取,同时保持了效率。大量实验表明,我们的方法在去雨、去模糊、去噪、去雾和增强这五个图像复原任务中,实现了性能与计算复杂度之间更好的平衡,并在高级视觉任务中表现出优越的性能。源代码将在https://github.com/House-yuyu/MDDA-former上提供。
引用
@article{arxiv.2411.07893,
title = {Joint multi-dimensional dynamic attention and transformer for general image restoration},
author = {Huan Zhang and Xu Zhang and Nian Cai and Jianglei Di and Yun Zhang},
journal= {arXiv preprint arXiv:2411.07893},
year = {2025}
}