边缘与阵列 AI 处理器性能分析:比较综述
硬件体系结构
2026-03-11 v1 计算机视觉与模式识别
机器学习
摘要
本综述审查了超低功耗边缘处理器快速演变的格局,涵盖异构系统芯片 (SoC)、神经加速器、近阵列和阵列架构以及新兴的数据流和以存储为中心的设计。我们根据计算范式、功耗范围和存储层次结构,对现可购及研究级平台进行分类,并分析其适用于始终就绪和延迟敏感人工智能 (AI) 工作负载的情形。为补充架构概览,本文在三个具有代表性的处理器上对 PicoSAM2(3.36 亿乘法累加 (MAC) 分割模型)进行基准测试:GAP9 采用多核 RISC-V 架构并配备硬件加速器;STM32N6 集成先进 ARM Cortex-M55 核心和专用神经架构加速器;Sony IMX500 代表阵列堆叠式补偬金属氧化物半导体 (CMOS) 计算。这些平台分别覆盖 MCU 级、嵌入式神经加速器和阵列计算范式。评估报告了延迟、推理效率、能源效率和能耗-延迟积。结果显示硬件行为呈现明显分化,IMX500 实现最高的利用率 (86.2 MAC/周期) 和最低的能耗-延迟积,凸显阵列处理技术的日益重要及其技术成熟度。GAP9 在 microcontroller 级功耗预算下实现最佳能源效率,STM32N6 在显著更高能耗下提供最低的原始延迟。综合本综述与基准测试,提供了当前设计方向及实际权衡的统一视图,塑造着下一代超低功耗和阵列 AI 处理器的发展。
引用
@article{arxiv.2603.08725,
title = {Performance Analysis of Edge and In-Sensor AI Processors: A Comparative Review},
author = {Luigi Capogrosso and Pietro Bonazzi and Michele Magno},
journal= {arXiv preprint arXiv:2603.08725},
year = {2026}
}
备注
Accepted at the IEEE International Instrumentation and Measurement Technology Conference (I2MTC) 2026