中文

ReGLA:基于门控线性注意力网络的高效感受野建模

计算机视觉与模式识别 2026-02-06 v1

摘要

在高分辨率图像上平衡精度与延迟是轻量级模型面临的关键挑战,尤其是Transformer-based架构常因延迟过大而受限。为此,我们引入ReGLA,一系列轻量级混合网络,集成高效卷积用于局部特征提取,结合基于ReLU的门控线性注意力进行全局建模。该设计包含三个关键创新:用于提升卷积效率同时保持大感受野的高效大感受野(ELRF)模块;用于保持线性复杂度并增强局部特征表示的ReLU门控调制注意力(RGMA)模块;以及多教师蒸馏策略以提升下游任务性能。广泛实验验证了ReGLA的优越性;其中ReGLA-M在ImageNet-1K上以224像素达到80.85%的Top-1准确率,仅以512像素4.98毫秒的延迟。此外,ReGLA在下游任务中优于规模相似的iFormer模型,实现COCO目标检测的3.1% AP提升和ADE20K语义分割的3.6% mIoU提升,确立其作为高分辨率视觉应用的前沿解决方案。

关键词

引用

@article{arxiv.2602.05262,
  title  = {ReGLA: Efficient Receptive-Field Modeling with Gated Linear Attention Network},
  author = {Junzhou Li and Manqi Zhao and Yilin Gao and Zhiheng Yu and Yin Li and Dongsheng Jiang and Li Xiao},
  journal= {arXiv preprint arXiv:2602.05262},
  year   = {2026}
}

备注

11 pages, 4 figures