中文

大语言模型能否战胜经典超参数优化算法?——基于autoresearch的实验研究

机器学习 2026-04-21 v5 机器学习

摘要

autoresearch 仓库允许 LLM 智能体通过直接编辑训练代码来优化超参数。我们将其用作测试平台,将经典 HPO 方法与 LLM 方法在固定计算预算下对小型语言模型的超参数调优进行比较。当在autoresearch上定义固定搜索空间时,诸如 CMA-ES 和 TPE 等经典方法在避免内存溢出故障方面优于 LLM 方法,其中这比搜索多样性更为关键。允许 LLM 直接编辑源代码虽然缩小了与经典方法的差距,但并未实际缩小差距,即便是当时可用的 Claude Opus 4.6 和 Gemini 3.1 Pro Preview 等前沿模型。我们观察到 LLM 在跨试验跟踪优化状态方面存在困难。相反,经典方法缺乏 LLM 的领域知识。为结合两者优势,我们引入 Centaur,一种混合方法,Centaur 共享 CMA-ES 的可解释内部状态,包括均值向量、步长和协方差矩阵,同时融合 LLM。Centaur 在我们的实验中取得最佳结果,0.8B 参数的 LLM 已足以超越所有经典和纯 LLM 方法。不受约束的代码编辑需要更大的模型才能与经典方法竞争。我们进一步分析了搜索多样性、模型从 0.8B 扩展到前沿模型的规模,以及对 Centaur 中 LLM 提议试验比例进行的消融实验。总体而言,我们的结果表明,LLM 最有效地作为经典优化器的补充,而非取代。代码可在 https://github.com/ferreirafabio/autoresearch-automl 上获取,交互式演示可在 https://ferreirafabio.github.io/autoresearch-automl 上访问。

关键词

引用

@article{arxiv.2603.24647,
  title  = {Can LLMs Beat Classical Hyperparameter Optimization Algorithms? A Study on autoresearch},
  author = {Fabio Ferreira and Lucca Wobbe and Arjun Krishnakumar and Frank Hutter and Arber Zela},
  journal= {arXiv preprint arXiv:2603.24647},
  year   = {2026}
}