满足 SLO,削减工时:面向企业的自动化 LLM 优化框架 OptiKIT
分布式、并行与集群计算
2026-01-29 v1 人工智能
摘要
企业 LLM 部署面临关键可扩展性挑战:组织必须在受限计算预算内系统化地优化模型,以规模化 AI 项目,然而手动优化所需的专业专业知识仍是稀缺且小众的技能。这一挑战在跨异构基础设施管理 GPU 利用率、使拥有不同工作负载且缺乏 LLM 优化经验的团队高效部署模型时尤为突出。我们提出 OptiKIT,一个分布式 LLM 优化框架,通过自动化复杂的优化工作流程来 democratize (民主化) 非专家团队的模型压缩和调优。OptiKIT 提供动态资源分配、分阶段管道执行以及自动清理,以及无缝的企业集成。在实际生产中,它实现了 2 倍以上的 GPU 吞吐量提升,使应用程序团队能够在不具备深入 LLM 优化专业知识的情况下实现持续的性能提升。我们分享了平台设计以及实现大规模、生产级民主化模型优化的关键工程洞见,包括资源分配算法、管道编排和集成模式。最后,我们开源了该系统,以便外部贡献和更广泛的可重复性。
引用
@article{arxiv.2601.20408,
title = {Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT},
author = {Nicholas Santavas and Kareem Eissa and Patrycja Cieplicka and Piotr Florek and Matteo Nulli and Stefan Vasilev and Seyyed Hadi Hashemi and Antonios Gasteratos and Shahram Khadivi},
journal= {arXiv preprint arXiv:2601.20408},
year = {2026}
}
备注
Accepted in MLSys 2026