中文

面向真实世界深度神经网络灵活端到端推理的异构存内计算集群

硬件体系结构 2022-01-05 v1 分布式、并行与集群计算 机器学习 神经与进化计算

摘要

在小型电池受限的物联网设备上部署现代 TinyML 任务需要高计算能效。使用非易失性存储器(NVM)的模拟存内计算(IMC)有望在深度神经网络(DNN)推理中实现显著的效率提升,并可作为 DNN 权重的片上存储。然而,IMC 在功能灵活性方面的局限性及其对性能、能耗和面积效率的影响在系统层面尚未被充分理解。针对实际的端到端物联网应用,IMC 阵列必须被封装于异构可编程系统中,这带来了新的系统级挑战,本文旨在解决这些问题。我们提出了一种异构紧耦合集群架构,集成了 8 个 RISC-V 核心、一个存内计算加速器(IMA)和数字加速器。我们在一个高度异构的工作负载(如 MobileNetV2 中的 Bottleneck 层)上对系统进行了基准测试,与核心上高度优化的并行执行相比,显示出 11.5 倍的性能和 9.5 倍的能效提升。此外,我们通过将异构架构扩展为多阵列加速器,探索了端到端推理完整移动级 DNN(MobileNetV2)对 IMC 阵列资源的需求。我们的结果表明,在 MobileNetV2 的端到端推理上,我们的解决方案在执行延迟方面比现有可编程架构优一个数量级,比集成存内计算模拟核心的最先进异构方案优两个数量级。

关键词

引用

@article{arxiv.2201.01089,
  title  = {A Heterogeneous In-Memory Computing Cluster For Flexible End-to-End Inference of Real-World Deep Neural Networks},
  author = {Angelo Garofalo and Gianmarco Ottavi and Francesco Conti and Geethan Karunaratne and Irem Boybat and Luca Benini and Davide Rossi},
  journal= {arXiv preprint arXiv:2201.01089},
  year   = {2022}
}

备注

14 pages (not including final biography page), 13 figures (excluded authors pictures)