中文

Optuna 与 Code Llama:LLM 是否是超参数调优的新范式?

太阳与恒星天体物理 2025-07-28 v1 地球与行星天体物理 星系天体物理

摘要

最优超参数选择是提高计算机视觉中神经网络性能的关键,尤其当网络结构日益复杂时。本文探讨了使用大语言模型(LLM)进行超参数优化的方法,通过对 Code Llama 进行参数高效微调(使用 LoRA)。生成的模型在广泛的视觉网络结构上能够产生准确且计算效率高的超参数建议。不同于 Optuna 等传统方法依赖资源密集的试错程序,本方法在保持竞争甚至优于 Tree-structured Parzen Estimators(TPE) 的均方根误差(RMSE) 的同时,大幅降低了计算开销。值得注意的是,所评估的模型涵盖了分类、检测和分割等以图像为中心的任务,这些任务是许多图像处理管线(包括增强、恢复和风格迁移)的基本组件。我们的结果表明,基于 LLM 的优化不仅与 established 的贝叶斯方法媲美,还能加速面向感知质量和低延迟处理的实际应用的调参。所有生成的配置均公开于 LEMUR Neural Network Dataset (https://github.com/ABrain-One/nn-dataset),作为超参数优化研究的开源基准,为提高图像处理系统的训练效率提供了实用资源。

关键词

引用

@article{arxiv.2504.06005,
  title  = {A deep search for Complex Organic Molecules toward the protoplanetary disk of V883 Ori},
  author = {Abubakar M. A. Fadul and Kamber R. Schwarz and Merel L. R. van 't Hoff and Jane Huang and Jennifer B. Bergner and Tushar Suhasaria and Jenny K. Calahan},
  journal= {arXiv preprint arXiv:2504.06005},
  year   = {2025}
}

备注

42 pages, 27 figures, accepted for publication in Astronomical Journal (AJ)