中文

轻量化骨干网络仅需自适应轻量级自注意力机制

计算机视觉与模式识别 2025-08-05 v1

摘要

当前,轻量化混合骨干网络在某种程度上缓解了计算饱和问题,但卷积神经网络(CNN)与注意力机制之间计算效率的不平衡问题日益凸显。具体而言,尽管线性注意力机制及其变体在轻量化设计方面取得了进展,但仍无法满足混合模型对长序列建模的需求。另一方面,现有轻量化SoftMax注意力计算通常通过缩小特征图大小来减少序列数量,从而压缩计算规模。然而,确定特征图缩减比例的过程繁琐,且计算饱和问题仍然存在。为此,本文提出一种具有自适应特征图大小的轻量化SoftMax注意力机制,命名为快速窗口注意力(Fast Window Attention, FWA),通过窗口聚合生成少量关键序列(Key 和 Value)进行注意力计算。此外,本文解释了在轻量化全局注意力机制中使用ReLU模拟SoftMax运算的合理性。最后,本文设计了全局-局部特征融合机制,并将其与 GhostNet 结合,提出一种轻量化混合骨干网络,命名为 LOLViT。通过分类(ImageNet 1K)、检测(COCO 2017)和分割(BDD100K)等视觉任务,以及大量消融实验,证明 LOLViT 在推理速度和模型准确率方面均优于同等水平的 CNN 模型。值得注意的是,LOLViT-X 的推理速度是 MobileViT-X 的 5 倍。

关键词

引用

@article{arxiv.2508.01385,
  title  = {Lightweight Backbone Networks Only Require Adaptive Lightweight Self-Attention Mechanisms},
  author = {Fengyun Li and Chao Zheng and Yangyang Fang and Jialiang Lan and Jianhua Liang and Luhao Zhang and Fa Si},
  journal= {arXiv preprint arXiv:2508.01385},
  year   = {2025}
}