Xformer:用于图像去噪的混合 X 形 Transformer
计算机视觉与模式识别
2024-02-27 v2
摘要
本文提出一种混合 X 形视觉 Transformer,名为 Xformer,在图像去噪任务上表现优异。我们探索增强来自不同范围的 token 的全局表示。具体而言,我们采用两类 Transformer 块。空间型 Transformer 块在由空间维度定义的 token 之间执行细粒度局部块交互。通道型 Transformer 块在由通道维度定义的 token 之间执行直接的全局上下文交互。基于并行网络结构,我们设计两条分支来实施这两种交互方式。在各分支内,我们采用编码器-解码器架构以捕获多尺度特征。此外,我们提出双向连接单元(BCU)来耦合这两条分支学到的表示,同时提供增强的信息融合。这些联合设计使我们的 Xformer 能够在空间和通道维度上强力进行全局信息建模。大量实验表明,在可比的模型复杂度下,Xformer 在合成与真实世界图像去噪任务上取得了最先进(SOTA)性能。我们还在 https://github.com/gladzhang/Xformer 提供了代码与模型。
引用
@article{arxiv.2303.06440,
title = {Xformer: Hybrid X-Shaped Transformer for Image Denoising},
author = {Jiale Zhang and Yulun Zhang and Jinjin Gu and Jiahua Dong and Linghe Kong and Xiaokang Yang},
journal= {arXiv preprint arXiv:2303.06440},
year = {2024}
}
备注
Accepted to ICLR 2024. Code and models are available at https://github.com/gladzhang/Xformer