中文

IPT-V2:使用分层注意力的高效图像处理Transformer

计算机视觉与模式识别 2024-04-02 v1

摘要

最近的进展证明了Transformer架构在图像恢复中的强大能力。然而,我们的分析表明,现有的基于Transformer的方法无法同时建立精确的全局和局部依赖关系,而这对于恢复退化图像的细节和缺失内容至关重要。为此,我们提出了一种具有分层注意力的高效图像处理Transformer架构,称为IPTV2,它采用焦点上下文自注意力(FCSA)和全局网格自注意力(GGSA)来在局部和全局感受野中获得充分的token交互。具体而言,FCSA将移位窗口机制应用于通道自注意力,有助于捕获跨通道的局部上下文和相互交互。而GGSA在跨窗口网格中构建长程依赖关系,在空间维度上聚合全局信息。此外,我们将结构重参数化技术引入前馈神经网络,以进一步提升模型能力。大量实验表明,我们提出的IPT-V2在涵盖去噪、去模糊和去雨的各种图像处理任务上取得了SOTA结果,并且在性能和计算复杂度方面比以前的方法获得了更好的权衡。此外,我们将方法扩展到图像生成作为潜在扩散主干,并显著优于DiTs。

关键词

引用

@article{arxiv.2404.00633,
  title  = {IPT-V2: Efficient Image Processing Transformer using Hierarchical Attentions},
  author = {Zhijun Tu and Kunpeng Du and Hanting Chen and Hailing Wang and Wei Li and Jie Hu and Yunhe Wang},
  journal= {arXiv preprint arXiv:2404.00633},
  year   = {2024}
}