识别与利用机器学习流水线构建模块以实现数据科学自动化工具的合理初始化
神经与进化计算
2016-08-01 v1 人工智能
机器学习
摘要
随着数据科学的普及程度不断提高,对数据科学工具的可扩展性、灵活性和易用性提出了越来越高的要求。特别是,自动化机器学习(AutoML)系统旨在自动化机器学习流水线的设计与优化过程。在本章中,我们提出了一种基于遗传编程的 AutoML 系统 TPOT,它通过优化一系列特征预处理器和机器学习模型,以期在监督分类问题上最大化分类准确率。此外,我们分析了一个包含以往用于解决各种监督分类问题的流水线的大型数据库,并识别出 100 个出现频率最高的机器学习操作短序列,我们将其称为机器学习流水线的构建模块。我们利用这些构建模块用有潜力的解来初始化 TPOT,并发现这种合理初始化方法显著提升了 TPOT 在一个基准测试上的性能,同时不会导致在其他基准测试上的性能显著下降。因此,利用机器学习流水线构建模块进行合理初始化对基于 GP 的 AutoML 系统展现出了潜力,应在未来的工作中进一步完善。
引用
@article{arxiv.1607.08878,
title = {Identifying and Harnessing the Building Blocks of Machine Learning Pipelines for Sensible Initialization of a Data Science Automation Tool},
author = {Randal S. Olson and Jason H. Moore},
journal= {arXiv preprint arXiv:1607.08878},
year = {2016}
}
备注
13 pages, 5 figures, preprint of chapter to appear in GPTP 2016 book