Deeploy: 在异构微控制器上实现小型语言模型的能效部署
机器学习
2024-08-09 v1 硬件体系结构
摘要
随着嵌入基础模型(EFMs)的兴起,尤其是小型语言模型(SLMs),将Transformer适配于边缘应用已成为一个非常活跃的研究领域。然而,在不依赖高带宽片外主存访问的情况下,在微控制器(MCU)级芯片上实现SLM的端到端部署仍然是一个开放挑战。本文我们展示了在多核RISC-V(RV32) MCU上高效端到端SLM部署,该MCU配备了机器学习指令扩展和硬件神经网络处理单元(NPU)。为了自动探索在异构(多核+NPU)资源上进行激进SLM部署所涉及的多维受限内存与计算权衡,我们引入了Deeploy——一种新型深度神经网络(DNN)编译器,它生成需要最少运行时支持的高度优化C代码。我们证明Deeploy生成了用于执行SLM的端到端代码,充分利用了RV32核心的指令扩展和NPU:我们实现了领先的能效和吞吐量——每标记,每秒,该SLM在TinyStories数据集上训练,首次在无外部存储的MCU级设备上运行。
引用
@article{arxiv.2408.04413,
title = {Deeploy: Enabling Energy-Efficient Deployment of Small Language Models On Heterogeneous Microcontrollers},
author = {Moritz Scherer and Luka Macan and Victor Jung and Philip Wiese and Luca Bompani and Alessio Burrello and Francesco Conti and Luca Benini},
journal= {arXiv preprint arXiv:2408.04413},
year = {2024}
}
备注
Accepted for publication at ESWEEK - CASES 2024