中文

小型 LLM 配合专家模块足以进行超参数调优

机器学习 2025-09-26 v3 计算与语言

摘要

超参数调优 (HPT) 是机器学习管道中必不可少的步骤, 但随着模型规模的增大, 计算成本高昂且过程晦涩难懂。最近的研究探索了利用大型语言模型 (LLM) 进行 HPT, 但大多数方法依赖参数超过 100 亿的模型。我们提出一种基于小型 LLM 的专家模块框架用于 HPT。其核心是轨迹上下文总结器 (Trajectory Context Summarizer, TCS), 这是一种确定性模块, 用于将原始训练轨迹转化为结构化上下文, 从而使小型 LLM 能够可靠地分析优化进展, 其可靠性与大型模型相当。我们使用两个本地运行的 LLM (phi4:reasoning14B 和 qwen2.5-coder:32B), 并在 10 次试验预算下, 我们的 TCS-enabled HPT 流水线在六个多样化任务上的平均性能与 GPT-4 相差约 0.9 个百分点。

关键词

引用

@article{arxiv.2509.15561,
  title  = {Small LLMs with Expert Blocks Are Good Enough for Hyperparamter Tuning},
  author = {Om Naphade and Saksham Bansal and Parikshit Pareek},
  journal= {arXiv preprint arXiv:2509.15561},
  year   = {2025}
}