SapientML:通过从人工编写的解决方案中学习来合成机器学习流水线
机器学习
2022-04-21 v2 人工智能
软件工程
摘要
自动机器学习(AutoML)有望通过大幅自动化数据科学家的工作,真正实现机器学习的民主化。然而,候选流水线的巨大组合搜索空间意味着当前的 AutoML 技术会生成次优流水线,或根本无法生成,尤其是在大型、复杂的数据集上。在这项工作中,我们提出了一种名为 SapientML 的 AutoML 技术,它可以从现有数据集及其人工编写的流水线语料库中学习,并为新数据集上的预测任务高效生成高质量流水线。为应对 AutoML 的搜索空间爆炸,SapientML 采用了一种新颖的分治策略,实现为三阶段程序合成方法,在逐次缩小的搜索空间上进行推理。第一阶段使用机器学习模型预测一组构成流水线的合理 ML 组件。第二阶段,利用从语料库和机器学习模型导出的语法约束,将其精炼为少量可行的具体流水线。在第三阶段动态评估这少数流水线,给出最佳解。我们将 SapientML 实例化为一个全自动工具链,该工具链通过挖掘 Kaggle 创建已清洗、带标签的学习语料库,从中学习,并使用学习到的模型为新预测任务合成流水线。我们创建了涵盖 170 个数据集的 1094 条流水线训练语料库,并在 41 个基准数据集(包括来自 Kaggle 的 10 个新的大型真实世界数据集)上针对 3 种最先进 AutoML 工具和 2 个基线对 SapientML 进行了评估。我们的评估表明,SapientML 在 27 个基准上取得了最佳或相当的准确率,而第二名工具在 9 个实例上甚至无法生成流水线。
引用
@article{arxiv.2202.10451,
title = {SapientML: Synthesizing Machine Learning Pipelines by Learning from Human-Written Solutions},
author = {Ripon K. Saha and Akira Ura and Sonal Mahajan and Chenguang Zhu and Linyi Li and Yang Hu and Hiroaki Yoshida and Sarfraz Khurshid and Mukul R. Prasad},
journal= {arXiv preprint arXiv:2202.10451},
year = {2022}
}
备注
Accepted to the Technical Track of ICSE 2022