NeuMMU:面向神经处理单元高效地址转换的体系结构支持
硬件体系结构
2019-11-19 v1 分布式、并行与集群计算
机器学习
神经与进化计算
摘要
为满足深度神经网络的计算与存储需求,神经处理单元(NPUs)正被广泛用于加速深度学习算法。类似于GPU从从属设备演进为主流处理器体系结构,NPUs很可能在这一快速演进的异构体系结构空间中成为一等公民。本文主张在NPUs中启用地址转换以解耦虚拟与物理内存地址空间。通过细致的数据驱动应用特征研究,我们定位了先前以GPU为中心的地址转换方案的若干局限,并提出了一种为NPUs量身定制的内存管理单元(MMU)。相较于理想MMU设计点,我们的方案仅带来平均0.06%的性能开销。
引用
@article{arxiv.1911.06859,
title = {NeuMMU: Architectural Support for Efficient Address Translations in Neural Processing Units},
author = {Bongjoon Hyun and Youngeun Kwon and Yujeong Choi and John Kim and Minsoo Rhu},
journal= {arXiv preprint arXiv:1911.06859},
year = {2019}
}