中文

Deeploy: 在异构微控制器上实现小型语言模型的能效部署

机器学习 2024-08-09 v1 硬件体系结构

摘要

随着嵌入基础模型(EFMs)的兴起,尤其是小型语言模型(SLMs),将Transformer适配于边缘应用已成为一个非常活跃的研究领域。然而,在不依赖高带宽片外主存访问的情况下,在微控制器(MCU)级芯片上实现SLM的端到端部署仍然是一个开放挑战。本文我们展示了在多核RISC-V(RV32) MCU上高效端到端SLM部署,该MCU配备了机器学习指令扩展和硬件神经网络处理单元(NPU)。为了自动探索在异构(多核+NPU)资源上进行激进SLM部署所涉及的多维受限内存与计算权衡,我们引入了Deeploy——一种新型深度神经网络(DNN)编译器,它生成需要最少运行时支持的高度优化C代码。我们证明Deeploy生成了用于执行SLM的端到端代码,充分利用了RV32核心的指令扩展和NPU:我们实现了领先的能效和吞吐量——每标记\SI490\micro\joule\perToken\SI{490}{\micro\joule \per Token},每秒\SI340Token\per\second\SI{340}{Token \per \second},该SLM在TinyStories数据集上训练,首次在无外部存储的MCU级设备上运行。

关键词

引用

@article{arxiv.2408.04413,
  title  = {Deeploy: Enabling Energy-Efficient Deployment of Small Language Models On Heterogeneous Microcontrollers},
  author = {Moritz Scherer and Luka Macan and Victor Jung and Philip Wiese and Luca Bompani and Alessio Burrello and Francesco Conti and Luca Benini},
  journal= {arXiv preprint arXiv:2408.04413},
  year   = {2024}
}

备注

Accepted for publication at ESWEEK - CASES 2024