中文

BoLT: democratize LLM 任务黑箱优化研究的基准

机器学习 2026-05-19 v1 人工智能

摘要

LLM训练和推理配置的优化,如超参数、数据混合和提示词,对于性能至关重要,但通常以启发式方式处理,导致可能次优的结果。通过将其建模为噪声、高成本且无导数的数值优化问题,贝叶斯优化(BO)和其他黑箱优化(BBO)方法为原创且样本高效的方法提供了前景,但在LLM社区大多数人面临成本高企的障碍,新方法往往仅在合成测试函数和小规模数据集上评估,无法真实再现现代LLM优化问题的挑战。这阻碍了BBO方法的发展,并使其难以评估在现代LLM任务上的有效性。我们引入BoLT,首个以LLM为中心的基准, democratize LLM研究以服务于BBO社区。BoLT覆盖广泛且充满动机的LLM优化问题,涉及多保真度、多目标、异方差噪声和高维搜索空间。BoLT中的每个问题都基于真实实验数据,通过拟合数千次真实LLM实验结果的轻量级替代模型而完全可复现且可访问。我们对BoLT进行了广泛的BO和BBO方法基准测试,显示所选BO方法在各类任务中一致优于其他方法,并揭示了现有BBO方法在LLM任务上存在的差距,凸显了为BBO社区现代化基准的必要性。

关键词

引用

@article{arxiv.2605.17000,
  title  = {BoLT: A Benchmark to Democratize Black-box Optimization Research for Expensive LLM Tasks},
  author = {Ruth Wan Theng Chew and Zhiliang Chen and Apivich Hemachandra and Bryan Kian Hsiang Low},
  journal= {arXiv preprint arXiv:2605.17000},
  year   = {2026}
}