面向 GPU 推理的乱序 VLIW JIT 编译器
分布式、并行与集群计算
2019-02-01 v2 机器学习
摘要
当前在硬件加速设备(例如 GPU、TPU)上进行机器学习(ML)推理的趋势显示出令人担忧的低利用率。由于 ML 推理日益受到严格延迟 SLO 的时间限制,增加数据并行度并非可行之策。对更高效率的需求促使了 GPU 复用。此外,现有的 GPU 编程抽象迫使程序员以早期绑定、无上下文的方式微管理 GPU 资源。我们提出了一种受 VLIW 启发的乱序(Out-of-Order, OoO)即时(Just-in-Time, JIT)编译器,它在运行时合并并重排执行内核,以实现吞吐最优的设备利用率,同时满足延迟 SLO。我们量化了仅空间复用和仅时间复用替代方案的低效性,并通过空间合并展示了可实现的 7.7 倍机会差距。
引用
@article{arxiv.1901.10008,
title = {The OoO VLIW JIT Compiler for GPU Inference},
author = {Paras Jain and Xiangxi Mo and Ajay Jain and Alexey Tumanov and Joseph E. Gonzalez and Ion Stoica},
journal= {arXiv preprint arXiv:1901.10008},
year = {2019}
}