中文

LSNet:看大,聚焦小

计算机视觉与模式识别 2025-04-01 v1

摘要

视觉网络设计,包括卷积神经网络和视觉Transformer,已经显著推进了计算机视觉领域。然而,其复杂的计算给实际部署带来了挑战,特别是在实时应用中。为了解决这个问题,研究人员探索了各种轻量级且高效的网络设计。然而,现有的轻量级模型主要利用自注意力机制和卷积进行token混合。这种依赖在轻量级网络的感知和聚合过程中带来了有效性和效率上的限制,阻碍了在有限计算预算下性能与效率之间的平衡。在本文中,我们从高效的人类视觉系统固有的动态异尺度视觉能力中汲取灵感,提出了一种用于轻量级视觉网络设计的“看大,聚焦小”策略。我们引入了LS(\textbf{L}arge-\textbf{S}mall)卷积,它结合了大核感知和小核聚合。它可以高效地捕获广泛的感知信息,并对动态和复杂的视觉表示实现精确的特征聚合,从而能够熟练地处理视觉信息。基于LS卷积,我们提出了LSNet,一种新的轻量级模型家族。大量实验表明,LSNet在各种视觉任务中实现了优于现有轻量级网络的性能和效率。代码和模型可在 https://github.com/jameslahm/lsnet 获取。

关键词

引用

@article{arxiv.2503.23135,
  title  = {LSNet: See Large, Focus Small},
  author = {Ao Wang and Hui Chen and Zijia Lin and Jungong Han and Guiguang Ding},
  journal= {arXiv preprint arXiv:2503.23135},
  year   = {2025}
}

备注

CVPR 2025 Camera-ready Version