基于合成分类问题集的AutoML算法基准测试
机器学习
2023-03-10 v3
摘要
自动化机器学习(AutoML)算法因其高性能及适应不同问题与数据集的灵活性而日益流行。随着AutoML算法数量的增加,决定哪一种最适合给定问题变得愈发困难。因此,有必要使用复杂且具挑战性的基准来区分不同的AutoML算法。本文比较了四种AutoML算法的性能:基于树的流水线优化工具(TPOT)、Auto-Sklearn、Auto-Sklearn 2与H2O AutoML。我们使用多样生成式机器学习基准(DIGEN),这是一组由生成函数导出的多样化合成数据集,旨在凸显常见机器学习算法性能的优劣。我们确认AutoML能够识别出在所有包含数据集中表现良好的流水线。多数AutoML算法表现相近;然而,根据具体数据集与所用指标的不同,仍存在某些差异。
引用
@article{arxiv.2212.02704,
title = {Benchmarking AutoML algorithms on a collection of synthetic classification problems},
author = {Pedro Henrique Ribeiro and Patryk Orzechowski and Joost Wagenaar and Jason H. Moore},
journal= {arXiv preprint arXiv:2212.02704},
year = {2023}
}