中文

在图像超分辨率 Transformer 中激活更多像素

图像与视频处理 2023-03-21 v3 计算机视觉与模式识别

摘要

基于 Transformer 的方法在低层视觉任务(如图像超分辨率)中已展现出令人印象深刻的性能。然而,我们通过归因分析发现,这些网络只能利用有限空间范围的输入信息。这意味着现有网络中 Transformer 的潜力仍未被充分挖掘。为了激活更多输入像素以获得更好的重建效果,我们提出了一种新颖的混合注意力 Transformer(HAT)。它结合了通道注意力和基于窗口的自注意力机制,从而利用二者在利用全局统计信息和强局部拟合能力方面的互补优势。此外,为了更好地聚合跨窗口信息,我们引入了重叠交叉注意力模块以增强相邻窗口特征间的交互。在训练阶段,我们额外采用同任务预训练策略以挖掘模型的进一步改进潜力。大量实验表明了所提模块的有效性,并且我们进一步放大模型规模以证明该任务的性能可大幅提升。我们的整体方法以超过 1dB 的优势显著优于最先进的方法。代码和模型可在 https://github.com/XPixelGroup/HAT 获取。

关键词

引用

@article{arxiv.2205.04437,
  title  = {Activating More Pixels in Image Super-Resolution Transformer},
  author = {Xiangyu Chen and Xintao Wang and Jiantao Zhou and Yu Qiao and Chao Dong},
  journal= {arXiv preprint arXiv:2205.04437},
  year   = {2023}
}

备注

Accepted to CVPR2023