中文

面向 GPU 推理的乱序 VLIW JIT 编译器

分布式、并行与集群计算 2019-02-01 v2 机器学习

摘要

当前在硬件加速设备(例如 GPU、TPU)上进行机器学习(ML)推理的趋势显示出令人担忧的低利用率。由于 ML 推理日益受到严格延迟 SLO 的时间限制,增加数据并行度并非可行之策。对更高效率的需求促使了 GPU 复用。此外,现有的 GPU 编程抽象迫使程序员以早期绑定、无上下文的方式微管理 GPU 资源。我们提出了一种受 VLIW 启发的乱序(Out-of-Order, OoO)即时(Just-in-Time, JIT)编译器,它在运行时合并并重排执行内核,以实现吞吐最优的设备利用率,同时满足延迟 SLO。我们量化了仅空间复用和仅时间复用替代方案的低效性,并通过空间合并展示了可实现的 7.7 倍机会差距。

关键词

引用

@article{arxiv.1901.10008,
  title  = {The OoO VLIW JIT Compiler for GPU Inference},
  author = {Paras Jain and Xiangxi Mo and Ajay Jain and Alexey Tumanov and Joseph E. Gonzalez and Ion Stoica},
  journal= {arXiv preprint arXiv:1901.10008},
  year   = {2019}
}