中文

MB-TaylorFormer V2:基于泰勒公式展开的改进多分支线性Transformer用于图像恢复

计算机视觉与模式识别 2025-04-15 v2

摘要

近年来,Transformer网络由于全局感受野和对输入的适应性,在图像恢复领域展现出卓越的性能。然而,Softmax注意力的二次计算复杂度严重限制了其在图像恢复任务中的广泛应用,特别是对于高分辨率图像。为了解决这一挑战,我们提出了一种新的Transformer变体。该变体利用泰勒展开来近似Softmax注意力,并利用范数保持映射的概念来近似一阶泰勒展开的余项,从而实现了线性计算复杂度。此外,我们将具有多尺度补丁嵌入的多分支架构引入到所提出的Transformer中,这具有四个显著优势:1)不同大小的感受野;2)多级语义信息;3)灵活形状的感受野;4)加速训练和推理速度。因此,所提出的模型,称为基于泰勒公式展开的Transformer第二版(简称MB-TaylorFormer V2),能够同时处理从粗到细的特征,以有限的计算成本捕获长距离像素交互,并改进泰勒展开余项的近似。在多个图像恢复基准上的实验结果表明,MB-TaylorFormer V2在多种图像恢复任务中实现了最先进的性能,如图像去雾、去雨、去雪、运动去模糊和去噪,且计算开销非常小。源代码可在 https://github.com/FVL2020/MB-TaylorFormerV2 获取。

关键词

引用

@article{arxiv.2501.04486,
  title  = {MB-TaylorFormer V2: Improved Multi-branch Linear Transformer Expanded by Taylor Formula for Image Restoration},
  author = {Zhi Jin and Yuwei Qiu and Kaihao Zhang and Hongdong Li and Wenhan Luo},
  journal= {arXiv preprint arXiv:2501.04486},
  year   = {2025}
}

备注

accepted by IEEE TPAMI