LLM-Pilot:刻画与优化您的LLM推理服务性能
分布式、并行与集群计算
2024-10-04 v1 计算与语言
机器学习
摘要
随着大语言模型(LLM)在快速增长中,LLM推理服务必须能够在满足性能要求的同时为来自数千个用户提供请求服务。LLM推理服务的性能主要取决于其部署的硬件,但要理解哪种硬件能满足性能要求仍然具有挑战性。本文提出LLM-Pilot——一种首创性的LLM推理服务性能刻画与预测系统。LLM-Pilot在多种GPU上对LLM推理服务进行基准测试,模拟真实工作负载,并针对所考虑的每种GPU优化服务配置以实现最佳性能。最后,利用这些刻画数据,LLM-Pilot学习一个预测模型,可用于为先前未见过的LLM推荐最具性价比的硬件。与现有方法相比,LLM-Pilot在满足性能要求方面更频繁地实现成功,同时平均降低成本60%。
引用
@article{arxiv.2410.02425,
title = {LLM-Pilot: Characterize and Optimize Performance of your LLM Inference Services},
author = {Małgorzata Łazuka and Andreea Anghel and Thomas Parnell},
journal= {arXiv preprint arXiv:2410.02425},
year = {2024}
}
备注
Accepted to the International Conference for High Performance Computing, Networking, Storage and Analysis (SC '24)