E-BATCH:高能效高吞吐的 RNN 批处理
分布式、并行与集群计算
2020-09-23 v1 硬件体系结构
机器学习
摘要
循环神经网络(RNN)推理由于时间步之间严格的数据依赖而表现出较低的硬件利用率。对多个请求进行批处理可提高吞吐量。然而,RNN 批处理需要大量填充,因为批处理的输入序列长度可能差异很大。每隔若干时间步动态更新批次的方案避免了填充,但要求在短时间内执行不同的 RNN 层,降低了能效。因此,我们提出 E-BATCH,一种面向 RNN 加速器的低延迟且高能效的批处理方案。它由运行时系统与有效的硬件支持组成。该运行时将多个序列拼接以创建大批次,从而大幅节省能耗。此外,当某序列的评估完成时,加速器会通知它,以便新序列可立即加入批次,从而大幅减少填充量。E-BATCH 动态控制每批次评估的时间步数,以在给定硬件平台上实现延迟与能效之间的最佳权衡。我们在 E-PUR 与 TPU 之上评估 E-BATCH。相较于最先进水平,在 E-PUR 中 E-BATCH 将吞吐量提升 1.8 倍、能效提升 3.6 倍,而在 TPU 中则将吞吐量提升 2.1 倍、能效提升 1.6 倍。
引用
@article{arxiv.2009.10656,
title = {E-BATCH: Energy-Efficient and High-Throughput RNN Batching},
author = {Franyell Silfa and Jose Maria Arnau and Antonio Gonzalez},
journal= {arXiv preprint arXiv:2009.10656},
year = {2020}
}