中文

ECLIP:空间分区GPU上ML推理的能效与实用共置

系统与控制 2025-06-17 v1 系统与控制

摘要

随着AI推理日益普及,研究已开始关注降低推理服务器的能耗。推理内核通常未充分利用GPU的计算资源,并浪费空闲组件的功耗。为提高利用率和能效,多个模型可以共置并共享GPU。然而,典型的GPU空间分区技术在重新配置空间分区时往往经历显著的开销,这可能通过重分区开销或非最优分区配置浪费额外能源。本文提出了ECLIP,一个实现低开销、能效内核级资源分区的框架,用于共置推理内核之间。ECLIP通过预分配CU掩码流池来最小化重分区开销,并通过我们的资源分配优化器为内核组分配最优CU分配。总体而言,ECLIP实现了平均13%的吞吐量提升和25%的能效提升。

关键词

引用

@article{arxiv.2506.12598,
  title  = {ECLIP: Energy-efficient and Practical Co-Location of ML Inference on Spatially Partitioned GPUs},
  author = {Ryan Quach and Yidi Wang and Ali Jahanshahi and Daniel Wong and Hyoseung Kim},
  journal= {arXiv preprint arXiv:2506.12598},
  year   = {2025}
}

备注

Accepted to ISLPED 2025