中文

HAT:用于图像复原的混合注意力 Transformer

计算机视觉与模式识别 2025-11-04 v3

摘要

基于 Transformer 的方法在图像超分辨率和去噪等图像复原任务中已展现出令人印象深刻的性能。然而,我们通过归因分析发现,这些网络仅能利用有限空间范围的输入信息。这意味着现有网络中 Transformer 的潜力仍未被充分挖掘。为了激活更多输入像素以获得更好的复原效果,我们提出了一种新的混合注意力 Transformer(HAT)。它结合了通道注意力与基于窗口的自注意力机制,从而利用二者的互补优势。此外,为了更好地聚合跨窗口信息,我们引入了重叠交叉注意力模块,以增强相邻窗口特征之间的交互。在训练阶段,我们还采用了同任务预训练策略,以进一步挖掘模型的潜力从而实现进一步提升。大量实验证明了所提模块的有效性。我们进一步放大模型规模,表明 SR 任务的性能可得到大幅改善。此外,我们将 HAT 扩展到更多图像复原应用,包括真实世界图像超分辨率、高斯图像去噪和图像压缩伪影去除。在基准数据集和真实世界数据集上的实验表明,我们的 HAT 在定量和定性方面均达到了最先进的性能。代码和模型已公开于 https://github.com/XPixelGroup/HAT。

关键词

引用

@article{arxiv.2309.05239,
  title  = {HAT: Hybrid Attention Transformer for Image Restoration},
  author = {Xiangyu Chen and Xintao Wang and Wenlong Zhang and Xiangtao Kong and Yu Qiao and Jiantao Zhou and Chao Dong},
  journal= {arXiv preprint arXiv:2309.05239},
  year   = {2025}
}

备注

Extended version of HAT. arXiv admin note: text overlap with arXiv:2205.04437