中文

eMamba:面向边缘计算的Mamba模型高效加速框架

机器学习 2025-08-15 v1 人工智能

摘要

状态空间模型(SSM)基于的机器学习架构最近因处理序列数据而获得了广泛关注。Mamba是一种最新的数据序列到序列SSM,准确率与计算效率优于最先进的transformer模型相当。尽管这种优势使Mamba在资源受限的边缘设备上具有巨大的潜力,但目前尚无针对此类环境的硬件加速框架进行优化部署。本文提出eMamba,一个为在边缘平台上部署Mamba模型而专门设计的全栈硬件加速框架。eMamba通过用轻量级硬件感知替代方案取代复杂的归一化层,对昂贵的操作(如SiLU激活和指数运算)进行近似处理,考虑目标应用。随后进行近似感知的神经网络架构搜索(NAS)以微调近似过程中使用的可学习参数。在Fashion-MNIST、CIFAR-10和MARS(一个开源的人体姿态估计算集)上进行评估,显示eMamba在参数数量减少1.63-19.9倍的情况下,准确率可与最先进技术相当。此外,它在大规模自然语言任务上也能很好地推广,在WikiText2数据集上表现稳定,无论序列长度如何变化。我们还将整个eMamba管道量化,并在AMD ZCU102 FPGA和使用GlobalFoundries(GF)22 nm技术的ASIC上实现。实验结果显示,延迟降低4.95-5.62倍,吞吐量提高2.22-9.95倍,面积缩小4.77倍,功耗降低9.84倍,能耗降低48.6倍,同时保持竞争力的准确率。

关键词

引用

@article{arxiv.2508.10370,
  title  = {eMamba: Efficient Acceleration Framework for Mamba Models in Edge Computing},
  author = {Jiyong Kim and Jaeho Lee and Jiahao Lin and Alish Kanani and Miao Sun and Umit Y. Ogras and Jaehyun Park},
  journal= {arXiv preprint arXiv:2508.10370},
  year   = {2025}
}

备注

Paper accepted at ESWEEK 2025 (CODES+ISSS) conference