中文

Vidur:面向 LLM 推理的大规模模拟框架

机器学习 2024-05-22 v2 人工智能 计算与语言

摘要

当前,优化大语言模型(LLM)的部署成本高昂,因为这需要在探索由并行策略、批处理技术和调度策略等系统旋钮构成的庞大配置空间时,针对 LLM 实现实验性地运行应用工作负载。为应对这一挑战,我们提出了 Vidur——一个用于 LLM 推理性能的大规模、高保真、易扩展的模拟框架。Vidur 结合实验性分析与预测建模来刻画 LLM 算子的性能,并通过估计延迟和吞吐量等多项关注指标来评估不同工作负载的端到端推理性能。我们在多个 LLM 上验证了 Vidur 的保真度,结果表明其在全范围内估计推理延迟的误差低于 9%。此外,我们提出了 Vidur-Search,一个用于优化 LLM 部署的配置搜索工具。Vidur-Search 利用 Vidur 自动识别满足应用性能约束的最具性价比的部署配置。例如,Vidur-Search 在 CPU 机器上仅用一小时便找到了 LLaMA2-70B 的最佳部署配置,相比之下,基于部署的探索需要 42K GPU 小时——花费约 21.8 万美元。Vidur 的源代码可在 https://github.com/microsoft/vidur 获取。

关键词

引用

@article{arxiv.2405.05465,
  title  = {Vidur: A Large-Scale Simulation Framework For LLM Inference},
  author = {Amey Agrawal and Nitin Kedia and Jayashree Mohan and Ashish Panwar and Nipun Kwatra and Bhargav Gulavani and Ramachandran Ramjee and Alexey Tumanov},
  journal= {arXiv preprint arXiv:2405.05465},
  year   = {2024}
}