中文

MogaNet:多阶门控聚合网络

计算机视觉与模式识别 2025-06-17 v4 人工智能

摘要

通过将卷积核上下文尽可能全局化,现代卷积网络在计算机视觉任务中展现出巨大潜力。然而,近期关于深度神经网络(DNNs)内多阶博弈论交互的研究揭示了现代卷积网络的表征瓶颈,即随着核尺寸增大,具表达力的交互并未被有效编码。为应对此挑战,我们提出一类新的现代卷积网络,称为 MogaNet,用于纯卷积网络模型中具有良好复杂度-性能权衡的判别性视觉表征学习。MogaNet 将概念简单而有效的卷积与门控聚合封装进紧凑模块,其中判别性特征被高效收集并自适应上下文化。与最先进的 ViTs 和 ConvNets 相比,MogaNet 在 ImageNet 及各种下游视觉基准(包括 COCO 目标检测、ADE20K 语义分割、2D&3D 人体姿态估计和视频预测)上展现出极佳的可扩展性、令人惊叹的参数效率与竞争力。值得注意的是,MogaNet 在 ImageNet-1K 上以 5.2M 和 181M 参数分别达到 80.0% 和 87.8% 准确率,优于 ParC-Net 和 ConvNeXt-L,同时分别节省 59% FLOPs 和 17M 参数。源代码见 https://github.com/Westlake-AI/MogaNet。

关键词

引用

@article{arxiv.2211.03295,
  title  = {MogaNet: Multi-order Gated Aggregation Network},
  author = {Siyuan Li and Zedong Wang and Zicheng Liu and Cheng Tan and Haitao Lin and Di Wu and Zhiyuan Chen and Jiangbin Zheng and Stan Z. Li},
  journal= {arXiv preprint arXiv:2211.03295},
  year   = {2025}
}

备注

ICLR 2024. Preprint V4 (35 pages, fixed typos). Code and models refer to https://github.com/Westlake-AI/MogaNet