Vau da muntanialas:高能效多芯片可扩展RNN推理加速
机器学习
2022-02-16 v1 人工智能
硬件体系结构
分布式、并行与集群计算
神经与进化计算
信号处理
摘要
长短期记忆(LSTM)等循环神经网络通过保持内部状态来学习时间依赖关系,使其成为语音识别等时间序列问题的理想选择。然而,输出到输入的反馈在为RNN设计加速器时带来了显著的内存带宽和可扩展性挑战。我们提出Muntaniala,一种用于LSTM推理的RNN加速器架构,在UMC 65 nm工艺下实测能效为3.25 TOP/s/W,性能为30.53 GOP/s。Muntaniala的可扩展设计可通过在脉动阵列中组合多个tile来运行大型RNN模型。我们将所有参数保持在阵列中每个die上静止,大幅减少I/O通信,仅加载新特征并与其他die共享部分结果。为量化包括I/O功耗在内的整体系统功耗,我们构建了Vau da Muntanialas,据我们所知,这是首个在PCB上实现RNN加速器脉动多芯片阵列的演示。我们的多die原型在330 μs内以总系统功耗9.0 mW(10 MHz下消耗2.95 μJ)完成192个隐藏状态的LSTM推理。针对Muntaniala中实现的8/16位量化,我们在TIMIT数据集上的3L-384NH-123NI LSTM网络上显示出相对于浮点(FP)音素错误率(PER)下降约3%。
引用
@article{arxiv.2202.07462,
title = {Vau da muntanialas: Energy-efficient multi-die scalable acceleration of RNN inference},
author = {Gianna Paulin and Francesco Conti and Lukas Cavigelli and Luca Benini},
journal= {arXiv preprint arXiv:2202.07462},
year = {2022}
}