VeloxNet: 轻量嵌入式图像分类的高效空间门控
计算机视觉与模式识别
2026-03-23 v1
摘要
在执行空中灾难监测和基础设施检查等任务时,将深度学习模型部署在嵌入式设备需要在模型大小、内存和延迟方面达到严格的准则平衡。本文介绍了 VeloxNet,这是一种用于嵌入式图像分类的轻量级 CNN 架构,用 gated 多层感知器 (gMLP) 块取代 SqueezeNet 的 fire 模块。每个 gMLP 块使用空间门控单元 (SGU),其应用学习到的空间投影和乘性门控,使网络能够在单层中捕获整个特征图上的空间依赖性。与受小卷积核定义的局部感受野受限的 fire 模块不同,SGU 在每一层提供全局空间建模且参数更少。我们在三个空中图像数据集上评估了 VeloxNet:用于紧急响应的空中图像数据库 (AIDER)、综合灾难数据集 (CDD) 和堤岸缺陷数据集 (LDD),与包括 MobileNet 变体、ShuffleNet、EfficientNet 和最近视觉转换器在内的十一个基线进行比较。VeloxNet 在 AIDER 上将参数数量减少 46.1%(从 740,970 降至 399,366),同时在 AIDER 上提高了加权 F1 分数 6.32%,在 CDD 上提高 30.83%,在 LDD 上提高 2.51%。这些结果表明,用空间门控块取代局部卷积模块可以提高资源受限部署的分类准确率和参数效率。论文接受后,源代码将公开发布。
引用
@article{arxiv.2603.19496,
title = {VeloxNet: Efficient Spatial Gating for Lightweight Embedded Image Classification},
author = {Md Meftahul Ferdaus and Elias Ioup and Mahdi Abdelguerfi and Anton Netchaev and Steven Sloan and Ken Pathak and Kendall N. Niles},
journal= {arXiv preprint arXiv:2603.19496},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication