中文

高效Concertormer用于图像去模糊及其他任务

计算机视觉与模式识别 2024-12-05 v3

摘要

过去几年中,Transformer架构在自然语言处理和高层视觉任务中取得了显著成功。然而,自注意力的固有复杂度与图像大小成二次关系,导致高分辨率视觉任务的计算成本难以承受。在本文中,我们介绍了Concertormer,其特点是一种新颖的Concerto自注意力(CSA)机制,专为图像去模糊设计。所提出的CSA将自注意力分为两个不同的部分:一部分强调一般的全局对应,另一部分专注于特定的局部对应。通过在与自注意力计算无关的额外维度中保留部分信息,我们的方法有效地捕获了全局上下文表示,其复杂度与图像大小成线性关系。为了有效利用这些额外维度,我们提出了一种跨维度通信模块,它线性组合注意力图,从而增强了表达能力。此外,我们使用所提出的门控深度可分离卷积MLP架构,将两阶段Transformer设计合并为单阶段。虽然我们的主要目标是单图像运动去模糊,但大量的定量和定性评估表明,我们的方法在其他任务(如去雨和带有JPEG伪影的去模糊)中表现优于最先进的方法。源代码和训练模型将向公众开放。

关键词

引用

@article{arxiv.2404.06135,
  title  = {Efficient Concertormer for Image Deblurring and Beyond},
  author = {Pin-Hung Kuo and Jinshan Pan and Shao-Yi Chien and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2404.06135},
  year   = {2024}
}