RedMulE:面向基于 RISC-V 的超低功耗 SoC 上自适应深度学习的紧凑型 FP16 矩阵乘法加速器
硬件体系结构
2022-04-26 v1
摘要
使用基于深度学习(DL)算法的极端边缘应用迅速激增,需要专用硬件以满足极端边缘应用在延迟、吞吐量与精度上的要求。尽管推理在实际案例中可行,通用 DL 模型的在线微调与适配仍极具挑战。关键障碍之一是对并行浮点运算的需求,这被认为在亚 100 mW 极端边缘 SoC 上难以承受。我们以 RedMulE(Reduced-precision matrix Multiplication Engine,精简精度矩阵乘法引擎)解决该问题,这是一种参数化低功耗 FP16 矩阵乘法硬件加速器——即 DL 训练与推理的主要内核——专为紧密集成于基于 PULP(Parallel Ultra-Low-Power,并行超低功耗)架构的微型 RISC-V 核心簇中而设计。在 22 nm 工艺下,一个 32-FMA 的 RedMulE 实例仅占用 0.07 mm^2(占 8 核 RISC-V 簇的 14%),并实现高达 666 MHz 的最高工作频率,吞吐量为 31.6 MAC/周期(98.8% 利用率)。我们达到簇级功耗 43.5 mW 与全簇能量效率 688 16 位 GFLOPS/W。总体而言,RedMulE 相比 8 个 RISC-V 核上的软件执行,能量效率最高提升 4.65 倍,速度提升 22 倍。
引用
@article{arxiv.2204.11192,
title = {RedMulE: A Compact FP16 Matrix-Multiplication Accelerator for Adaptive Deep Learning on RISC-V-Based Ultra-Low-Power SoCs},
author = {Yvan Tortorella and Luca Bertaccini and Davide Rossi and Luca Benini and Francesco Conti},
journal= {arXiv preprint arXiv:2204.11192},
year = {2022}
}