LLMSYS-HPOBench:面向真实 LLM 系统的超参数优化基准套件
机器学习
2026-05-12 v1 人工智能
计算与语言
性能
软件工程
摘要
大型语言模型(LLM)系统是当前人工智能在众多应用领域的前沿,带来了针对 AutoML 社区的超参数优化(HPO)的新挑战和机遇。然而,这类系统展现出前所未有的超参数配置空间,涵盖来自 AI 与非 AI 组件的配置;丰富且非线性的保真因素影响;以及测量超参数配置成本的多样性,这些因素在现有基准测试中都未被充分捕捉。本文提出了第一个(实时)基准套件和数据集,用于真实 LLM 系统的 HPO,称为 LLMSYS-HPOBench,涵盖来自运行 LLM 系统所绘制的超参数配置的推断目标值数据。目前,LLMSYS-HPOBench 包含 364,450 组超参数配置,维度为 12-23,3-5 维保真因素导致 932 种设置,3-9 个推断目标指标,以及 2-10 个成本指标,伴随测量 LLM 系统的生成日志。我们倡导的不仅是对现有 HPO 算法在前沿 LLM 系统上的重新验证,更提供一个不断演进的平台,供 AutoML 社区探索此方面的新研究方向。该基准套件已在 https://github.com/ideas-labo/llmsys-hpobench 上公开。
引用
@article{arxiv.2605.08305,
title = {LLMSYS-HPOBench: Hyperparameter Optimization Benchmark Suite for Real-World LLM Systems},
author = {Siyu Wu and Yulong Ye and Zezhen Xiang and Pengzhou Chen and Gangda Xiong and Tao Chen},
journal= {arXiv preprint arXiv:2605.08305},
year = {2026}
}