面向真实世界深度神经网络灵活端到端推理的异构存内计算集群
硬件体系结构
2022-01-05 v1 分布式、并行与集群计算
机器学习
神经与进化计算
摘要
在小型电池受限的物联网设备上部署现代 TinyML 任务需要高计算能效。使用非易失性存储器(NVM)的模拟存内计算(IMC)有望在深度神经网络(DNN)推理中实现显著的效率提升,并可作为 DNN 权重的片上存储。然而,IMC 在功能灵活性方面的局限性及其对性能、能耗和面积效率的影响在系统层面尚未被充分理解。针对实际的端到端物联网应用,IMC 阵列必须被封装于异构可编程系统中,这带来了新的系统级挑战,本文旨在解决这些问题。我们提出了一种异构紧耦合集群架构,集成了 8 个 RISC-V 核心、一个存内计算加速器(IMA)和数字加速器。我们在一个高度异构的工作负载(如 MobileNetV2 中的 Bottleneck 层)上对系统进行了基准测试,与核心上高度优化的并行执行相比,显示出 11.5 倍的性能和 9.5 倍的能效提升。此外,我们通过将异构架构扩展为多阵列加速器,探索了端到端推理完整移动级 DNN(MobileNetV2)对 IMC 阵列资源的需求。我们的结果表明,在 MobileNetV2 的端到端推理上,我们的解决方案在执行延迟方面比现有可编程架构优一个数量级,比集成存内计算模拟核心的最先进异构方案优两个数量级。
引用
@article{arxiv.2201.01089,
title = {A Heterogeneous In-Memory Computing Cluster For Flexible End-to-End Inference of Real-World Deep Neural Networks},
author = {Angelo Garofalo and Gianmarco Ottavi and Francesco Conti and Geethan Karunaratne and Irem Boybat and Luca Benini and Davide Rossi},
journal= {arXiv preprint arXiv:2201.01089},
year = {2022}
}
备注
14 pages (not including final biography page), 13 figures (excluded authors pictures)