中文

基于集成方法的深度学习超参数优化:用于质子结构的应用

高能物理 - 唯象学 2024-10-22 v1 高能物理 - 实验 计算物理

摘要

深度学习模型以大量超参数定义,例如网络结构和优化器设置。这些超参数必须与模型参数(如网络权重)分开确定,常以事方法或通过手动检查结果来固定。算法化、客观的超参数确定要求引入不同于模型训练所采用的目标度量。本文提出了一种新方法,用于基于从模型空间采样的模型集 ensemble 中构建的统计估计器来自动确定深度学习模型的超参数。该策略需要同时并行训练数百个模型,可通过部署 GPU 等硬件加速器有效实现。作为概念验证,我们将此方法应用于 NNPDF 框架中质子亚结构的确定,展示了结果模型不确定性估计的鲁棒性。新的 GPU 优化 NNPDF 代码实现了最高可达两个数量级的加速,内存需求稳定,能源消耗降低最高可达 90%,与顺序 CPU-based 模型训练相较。虽然聚焦于质子结构,但该方法完全通用,可应用于任何依赖于超参数优化的集 ensemble 模型的深度学习问题。

关键词

引用

@article{arxiv.2410.16248,
  title  = {Hyperparameter Optimisation in Deep Learning from Ensemble Methods: Applications to Proton Structure},
  author = {Juan Cruz-Martinez and Aaron Jansen and Gijs van Oord and Tanjona R. Rabemananjara and Carlos M. R. Rocha and Juan Rojo and Roy Stegeman},
  journal= {arXiv preprint arXiv:2410.16248},
  year   = {2024}
}

备注

27 pages, 7 figures