中文

面向视觉识别的空间强化标记聚合网络

计算机视觉与模式识别 2025-07-16 v1 人工智能

摘要

ConvNeXt 等 CNN 在视觉识别任务中的复兴,展示了其通过先进的训练方法和受 ViT 启发的设计原则能够与 transformer-based 架构一较高下。然而,CNN 和 transformer 都表现出一种简单偏差,偏好简单特征而非复杂的结构表示。此外,现代 CNN 常集成类似于 transformer 中的 MLP-like 块,但这些块存在显著的信息冗余,为维持竞争性能需要较高的扩展比率。为此,我们提出 SpaRTAN,一种轻量级架构设计,通过增强空间和通道维信息处理来提升性能。SpaRTAN 采用可由核大小和膨胀因子控制的不同感受野的核,有效捕获判别性的多阶空间特征。进一步,一种基于波动的通道聚合模块调制并强化像素互动,减轻通道冗余。将上述两个模块结合,所提网络能够高效收集并动态地对判别性特征进行上下文化。在 ImageNet 和 COCO 上的实验结果表明,SpaRTAN 在保持竞争性能的同时实现了惊人的参数效率。特别是在 ImageNet-1k 基准上,SpaRTAN 以77.7% 的准确率、仅3.8M 参数和约1.0 GFLOPs 实现,展示了其通过高效设计实现强大性能的能力。在 COCO 基准上,它实现了50.0% 的 AP,超越前一基准1.2%,仅需21.5M 参数。代码已公开于 https://github.com/henry-pay/SpaRTAN。

关键词

引用

@article{arxiv.2507.10999,
  title  = {SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition},
  author = {Quan Bi Pay and Vishnu Monn Baskaran and Junn Yong Loo and KokSheik Wong and Simon See},
  journal= {arXiv preprint arXiv:2507.10999},
  year   = {2025}
}

备注

Accepted at International Joint Conference on Neural Networks (IJCNN 2025)