面向端侧视觉任务的极低内存 CNN 设计
计算机视觉与模式识别
2024-10-15 v2
摘要
本文提出了一种内存高效的 CNN(卷积神经网络),使资源受限的低端嵌入式和物联网设备能够使用极低内存(即 ImageNet 分类仅需 63 KB)执行端侧视觉任务,如图像分类和目标检测。基于 MobileNet 的瓶颈块,我们提出了三条设计原则,显著抑制 CNN 的峰值内存使用,使其能够适配低端设备有限的 KB 级内存。首先,'输入分割'将输入图像划分为一组补丁,包括与其他补丁重叠的中心补丁,从而减小大输入图像的尺寸(和内存需求)。其次,'补丁隧道'为每个补丁构建由多个瓶颈块组成的独立隧道式路径,从输入补丁贯穿至网络的最后一层,使整个网络保持轻量级内存使用。最后,'瓶颈重排序'重新排列瓶颈块内卷积操作的执行顺序,使得内存使用量不随卷积输出通道的大小而变化。实验结果表明,所提出的网络以极低内存(即 63 KB)对 ImageNet 进行分类,同时取得了具有竞争力的 top-1 准确率(即 61.58%)。据我们所知,所提出网络的内存使用远小于最先进的 memory-efficient 网络,即分别比 MobileNet(即 5.6 MB)和 MCUNet(即 196 KB)小 89 倍和 3.1 倍。
引用
@article{arxiv.2408.03663,
title = {Designing Extremely Memory-Efficient CNNs for On-device Vision Tasks},
author = {Jaewook Lee and Yoel Park and Seulki Lee},
journal= {arXiv preprint arXiv:2408.03663},
year = {2024}
}