DiNAT-IR:探索扩张邻域注意力用于高质量图像恢复
计算机视觉与模式识别
2025-07-25 v1
摘要
Transformer 由于其自注意力机制能够建模长程依赖关系,已成为图像恢复任务中的主导范式。然而,其自注意力的高计算成本限制了对高分辨率图像的可扩展性,使得效率与质量之间的权衡成为关键研究焦点。为此,Restormer 采用通道级自注意力,计算维度为通道而非空间。虽然有效,但可能忽略了对高质量图像恢复至关重要的局部瑕疵。为弥合这一差距,我们探索了受高层视觉任务成功经验启发的扩张邻域注意力 (DiNA)。DiNA 通过整合滑动窗口注意力与混合膨胀因子,平衡了全局语境与局部精度,有效扩大感受野而又不增加额外开销。然而,我们的初步实验表明,将这种全局-局部设计直接应用于经典去模糊任务会阻碍准确的视觉恢复,主要由于局部注意力中对全局语境理解受限。为此,我们引入一个通道感知模块,补充局部注意力,有效整合全局语境而不牺牲像素级精度。我们提出的 DiNAT-IR 作为专为图像恢复设计的 Transformer 架构,跨越多个基准实现了具竞争力的效果,为多样化的低层计算机视觉问题提供了高质量解决方案。
关键词
引用
@article{arxiv.2507.17892,
title = {DiNAT-IR: Exploring Dilated Neighborhood Attention for High-Quality Image Restoration},
author = {Hanzhou Liu and Binghan Li and Chengkai Liu and Mi Lu},
journal= {arXiv preprint arXiv:2507.17892},
year = {2025}
}