EDCA——面向高效流水线的进化数据中心AutoML框架
机器学习
2025-04-15 v2
摘要
自动化机器学习(AutoML)因对机器学习(ML)专家需求的增加而广受欢迎,使其能够轻松快速地应用ML技术。AutoML实现使用优化方法来识别给定数据集的最有效ML解决方案,旨在改善一个或多个预定义指标。然而,大多数实现聚焦于模型选择和超参数调优。尽管数据质量是获得高性能ML系统的重要因素,但它通常是AutoML中被忽视的部分,仍然是一项耗时的手动任务。本工作提出了EDCA,一个进化数据中心AutoML框架。除了选择最佳模型和超参数等传统任务外,EDCA通过优化数据处理任务(如数据降维和清洗)来增强给定数据,以满足问题需求。所有这些步骤构成了由进化算法优化的ML流水线。为评估其有效性,EDCA与FLAML和TPOT这两个AutoML基准排名靠前的框架进行了比较。这些框架在相同条件下使用AMLB分类基准数据集进行评估。EDCA在性能上取得了与FLAML和TPOT统计上相似的结果,但训练最终解决方案所用的数据显著更少。此外,EDCA的实验结果表明,使用更少的数据和符合绿色AutoML指南的高效ML算法方面可以实现良好性能。
引用
@article{arxiv.2503.04350,
title = {EDCA - An Evolutionary Data-Centric AutoML Framework for Efficient Pipelines},
author = {Joana Simões and João Correia},
journal= {arXiv preprint arXiv:2503.04350},
year = {2025}
}
备注
preprint for EvoApplications 2025