CMA-ES用于AutoML中事后集成:巨大成功与可挽救的失败
机器学习
2023-07-04 v1 神经与进化计算
摘要
许多最先进的自动化机器学习(AutoML)系统使用Caruana等人(2004)的贪婪集成选择(GES)在模型选择后对已发现的模型进行集成。从而提升预测性能,并可能遵循Auto-Sklearn 1的见解:诸如堆叠或梯度无关数值优化等替代方案会过拟合。Auto-Sklearn 1中的过拟合比其他AutoML系统更可能发生,因为它仅使用低质量验证数据进行事后集成。因此,我们受到激励去分析Auto-Sklearn 1的见解对于具有更高质量验证数据的系统是否成立。继而,我们在来自AutoML基准的71个分类数据集上,针对AutoGluon比较了协方差矩阵适应进化策略(CMA-ES)(最先进的梯度无关数值优化)与GES的性能。我们发现Auto-Sklearn的见解依赖于所选度量。对于ROC AUC度量,CMA-ES严重过拟合并被GES超越——在多类分类上统计显著。对于平衡准确率度量,CMA-ES不过拟合并显著优于GES。受CMA-ES在平衡准确率上成功应用的启发,我们探索了阻止CMA-ES在ROC AUC上过拟合的方法。我们提出了一种受GES启发的归一化CMA-ES所产生权重的方法,避免了CMA-ES的过拟合,并使CMA-ES在ROC AUC上优于或类似于GES。
引用
@article{arxiv.2307.00286,
title = {CMA-ES for Post Hoc Ensembling in AutoML: A Great Success and Salvageable Failure},
author = {Lennart Purucker and Joeran Beel},
journal= {arXiv preprint arXiv:2307.00286},
year = {2023}
}
备注
10 pages main paper, 13 pages references and appendix, 4 figures, 14 subfigures, 10 tables, to be published in: International Conference on Automated Machine Learning 2023