MATCH: 基于 TVM 的模型感知异构边缘设备编译
摘要
将深度神经网络 (DNN) 部署在异构边缘平台上(例如,将同一微控制器单元 (MCU) 内的指令处理器与用于张量计算的硬件加速器耦合),正成为 TinyML 领域的关键挑战之一。最佳表现的 DNN 编译工具链通常针对单个 MCU 系列进行深度定制,而将其移植到不同的异构 MCU 系列则意味着几乎重新开发整个编译器。相反,面向 retargetable 编译器(如 TVM)的工具链无法利用定制加速器的能力,导致生成通用但未优化的代码。为克服这一二元性,我们引入 MATCH,一种新型基于 TVM 的 DNN 部署框架,旨在通过可定制的模型驱动硬件抽象,实现跨不同 MCU 处理器和加速器的轻松灵活的 retargeting。我们展示了,仅需定义抽象硬件模型和 SoC-specific API,就能通过增强硬件成本模型的通用且 retargetable 映射框架,与甚至超过针对不同目标的定制工具链相竞争。我们在两款最先进的异构 MCU(GAP9 和 DIANA)上进行测试。在 MLPerf Tiny 套件的四个 DNN 模型上,MATCH 相较于使用 plain TVM 在 DIANA 上将推理延迟降低最高可达 60.88 倍, thanks to the on-board HW accelerator 的利用。在 HTVM(针对 DIANA 的完全定制工具链)之上,我们仍将延迟降低 16.94%。在 GAP9 上,同样的基准测试显示,我们相较于专用 DORY 编译器提高了 2.15 倍的性能, thanks to our heterogeneous DNN mapping approach that synergically exploits the DNN accelerator and the eight-cores cluster available on board。
引用
@article{arxiv.2410.08855,
title = {MATCH: Model-Aware TVM-based Compilation for Heterogeneous Edge Devices},
author = {Mohamed Amine Hamdi and Francesco Daghero and Giuseppe Maria Sarda and Josse Van Delm and Arne Symons and Luca Benini and Marian Verhelst and Daniele Jahier Pagliari and Alessio Burrello},
journal= {arXiv preprint arXiv:2410.08855},
year = {2024}
}
备注
13 pages, 11 figures, 4 tables