中文

DRCT:使图像超分辨率摆脱信息瓶颈

计算机视觉与模式识别 2024-11-26 v5 人工智能

摘要

近年来,基于 Vision Transformer 的低级视觉任务方法取得了广泛成功。与基于 CNN 的模型不同,Transformer 更擅长捕获长距离依赖关系,能够利用非局部信息重建图像。在超分辨率领域,基于 Swin-transformer 的模型因其全局空间信息建模能力以及促进不同窗口间信息交换的移位窗口注意力机制而成为主流。许多研究人员通过扩大感受野或设计精细的网络来提升模型性能,取得了令人称赞的结果。然而,我们观察到,特征图强度在网络末端被突然抑制至较小值是一个普遍现象。这意味着信息瓶颈和空间信息的减少,隐式地限制了模型的潜力。为了解决这个问题,我们提出了 Dense-residual-connected Transformer(DRCT),旨在通过层间的密集残差连接减轻空间信息的损失并稳定信息流,从而释放模型的潜力,使模型摆脱信息瓶颈。实验结果表明,我们的方法在基准数据集上超越了 SOTA 方法,并在 NTIRE-2024 图像超分辨率(x4)挑战赛中表现优异。我们的源代码可在 https://github.com/ming053l/DRCT 获取。

关键词

引用

@article{arxiv.2404.00722,
  title  = {DRCT: Saving Image Super-resolution away from Information Bottleneck},
  author = {Chih-Chung Hsu and Chia-Ming Lee and Yi-Shiuan Chou},
  journal= {arXiv preprint arXiv:2404.00722},
  year   = {2024}
}

备注

Accepted by CVPRW2024, NTIRE Image Super-resolution (x4)