NTX:一款用于22nm FD-SOI中浮点广义归约工作负载的节能流式加速器
分布式、并行与集群计算
2018-12-04 v1 硬件体系结构
摘要
针对乘加(MAC)密集型工作负载(如深度学习)的专用协处理器在SoC平台中正变得普遍,从GPU到移动SoC皆是如此。在本文中,我们将NTX(一款为大规模训练深度神经网络而开发的高效加速器)重新审视为一种广义MAC与归约流式引擎。该架构由一组32位浮点流式协处理器组成,它们松散耦合到一个负责编排数据移动与计算的RISC-V核。近期在22 nm FD-SOI工艺下的硅后布局结果显示,该加速器能够在1.25 GHz、168 mW下提供高达20 Gflop/s的算力。基于这些结果,我们展示了一个缩放至14 nm的NTX版本相较于当代GPU可实现3倍能效提升,且硅面积减少10.4倍,并以全浮点精度训练大型前沿网络时达到1.4 Tflop/s的计算性能。对MAC密集型核的扩展评估表明,NTX在机器学习之外的通用归约工作负载上可稳定达到其峰值性能的87%。其模块化架构支持从高性能GPU级到低功耗嵌入式场景的不同规模部署。
引用
@article{arxiv.1812.00182,
title = {NTX: An Energy-efficient Streaming Accelerator for Floating-point Generalized Reduction Workloads in 22nm FD-SOI},
author = {Fabian Schuiki and Michael Schaffner and Luca Benini},
journal= {arXiv preprint arXiv:1812.00182},
year = {2018}
}
备注
6 pages, invited paper at DATE 2019