中文

统一维度:轻量级图像超分辨率的线性自适应方法

计算机视觉与模式识别 2024-09-27 v1

摘要

基于窗口的transformer因其通过局部自注意力(SA)实现的自适应建模能力,在超分辨率任务中表现出色。然而,它们的计算复杂度和推理延迟高于卷积神经网络。本文首先识别到,Transformer的可适应性源于其自适应空间聚合和先进的结构设计,而其高延迟则源于局部SA相关的计算成本和内存布局转换。为模拟这种聚合方法,我们提出了一种有效的基于卷积的线性可分离注意(FSA),实现长程动态建模且具有线性复杂度。此外,我们引入一种有效的双分支结构结合超轻量信息交换模块(IEM),以增强Token Mixer的信息聚合。最后,针对结构,我们修改现有的基于空间门控的前馈神经网络,纳入自门控机制以保留高维通道信息,从而实现更复杂关系的建模。通过这些进步,我们构建了一个基于卷积的Transformer框架,称为线性自适应混合网络(LAMNet)。大量实验表明,LAMNet在保持卷积神经网络计算效率的同时,优于现有基于SA的Transformer方法,可实现推理时间的 3×3\times 加速。代码将公开于:https://github.com/zononhzy/LAMNet。

关键词

引用

@article{arxiv.2409.17597,
  title  = {Unifying Dimensions: A Linear Adaptive Approach to Lightweight Image Super-Resolution},
  author = {Zhenyu Hu and Wanjie Sun},
  journal= {arXiv preprint arXiv:2409.17597},
  year   = {2024}
}