中文

一款 3 TOPS/W RISC-V 并行簇用于细粒度混合精度量化神经网络推理

硬件体系结构 2023-07-04 v1

摘要

部署深度神经网络(DNNs)等复杂算法的趋势日益对物联网(IoT)终端节点提出严格的存储和能效要求。混合精度量化已被提出作为一种技术,以最小化 DNN 的存储占用并最大化其执行效率,且端到端精度退化可忽略。在本文中,我们提出了一种用于混合精度量化神经网络(QNNs)高能效推理的新型硬件和软件栈。我们介绍了 Flex-V,一种基于 RISC-V 指令集架构(ISA)的处理器,具有融合的 Mac&Load 混合精度点积指令;为避免由混合精度变体导致的编码空间指数增长,我们将格式编码到控制状态寄存器(CSRs)中。Flex-V 核心集成到一个由八个处理器组成的紧耦合簇中;此外,我们提供了一个用于 DNN 端到端部署的完整框架,包括编译器、优化库和存储感知部署流程。我们的结果显示,该簇在商用 22nm FDX 工艺上实现了高达 91.5 MAC/周期和 3.26 TOPS/W,加速比高达 8.5 倍,且相对于基线面积开销仅 5.6%。为展示该架构的能力,我们使用端到端真实 QNNs 对其进行基准测试,相较于使用全灵活可编程处理器的现有方案,性能提升 2 倍至 2.5 倍。

关键词

引用

@article{arxiv.2307.01056,
  title  = {A 3 TOPS/W RISC-V Parallel Cluster for Inference of Fine-Grain Mixed-Precision Quantized Neural Networks},
  author = {Alessandro Nadalini and Georg Rutishauser and Alessio Burrello and Nazareno Bruschi and Angelo Garofalo and Luca Benini and Francesco Conti and Davide Rossi},
  journal= {arXiv preprint arXiv:2307.01056},
  year   = {2023}
}