超参数对大语言模型推理性能的影响:vLLM 与 HuggingFace Pipelines 的评估
软件工程
2024-08-05 v1 计算与语言
机器学习
摘要
近期,开源大语言模型(LLM)的涌现使开发者能够在保持对隐私和合规性等方面掌控权的同时,创建基于 AI 的解决方案,从而提供模型部署过程的治理和所有权。要利用这些 LLM,仍需推理引擎。这些引擎将模型权重加载到可用资源(如 GPU)上,并处理查询以生成响应。LLM 的推理速度,即性能,对实时应用至关重要,因为其每一次推理都要计算数百万或数十亿次浮点运算。最近涌现的先进推理引擎,如 vLLM,融合了高效内存管理等新型机制,以实现最先进的性能。本文分析了使用 vLLM 和 HuggingFace pipelines 两个推理库对 20 个 LLM 的性能,特别是吞吐量(单位时间内生成的 token 数)。我们研究了各种超参数——开发者必须配置的这些参数——如何影响推理性能。我们的结果表明,吞吐量轮廓呈不规则分布,存在显著的峰值,这凸显了针对实现最大性能进行超参数优化的重要性。我们还展示,在升级或降级用于推理的 GPU 模型时,应用超参数优化可使 HuggingFace pipelines 的吞吐量平均提高 9.16% 和 13.7%。
引用
@article{arxiv.2408.01050,
title = {The Impact of Hyperparameters on Large Language Model Inference Performance: An Evaluation of vLLM and HuggingFace Pipelines},
author = {Matias Martinez},
journal= {arXiv preprint arXiv:2408.01050},
year = {2024}
}