SubStrat:一种基于子集策略的更快速AutoML方法
机器学习
2024-12-31 v1 数据库
神经与进化计算
摘要
自动化机器学习(AutoML)框架已成为数据科学家武器库中的重要工具,因为它们显著减少了构建机器学习流水线所需的手工劳动。此类框架在数百万种可能的ML流水线(通常包含特征工程、模型选择与超参数调优步骤)中智能搜索,并最终输出在预测精度上最优的流水线。然而,当数据集较大时,每个单独配置的执行时间更长,因此整体AutoML运行时间变得越来越高。为此,我们提出SubStrat,一种处理数据规模而非配置空间的AutoML优化策略。它封装现有的AutoML工具,并非直接在完整数据集上执行,而是使用基于遗传的算法寻找一个小而具代表性的数据子集,以保留完整数据的特定特征。随后它在小子集上调用AutoML工具,最后通过在大数据集上执行受限且短得多的AutoML过程来精炼所得流水线。我们在两个流行的AutoML框架Auto-Sklearn和TPOT上的实验结果表明,SubStrat将其运行时间平均减少了79%,而所得ML流水线的精度平均损失小于2%。
引用
@article{arxiv.2206.03070,
title = {SubStrat: A Subset-Based Strategy for Faster AutoML},
author = {Teddy Lazebnik and Amit Somech and Abraham Itzhak Weinberg},
journal= {arXiv preprint arXiv:2206.03070},
year = {2024}
}