AutoGluon-Tabular:面向结构化数据的鲁棒且准确的自动机器学习
机器学习
2020-03-17 v1 机器学习
摘要
我们介绍了 AutoGluon-Tabular,一个开源的 AutoML(自动机器学习)框架,仅需一行 Python 代码即可在未经处理的表格数据集(如 CSV 文件)上训练出高度准确的机器学习模型。与现有主要聚焦于模型/超参数选择的 AutoML 框架不同,AutoGluon-Tabular 通过对多个模型进行集成并将其堆叠为多层而取得成功。实验表明,相较于寻找最佳模型,我们对众多模型的多层组合能更好地利用所分配的训练时间。第二项贡献是对包括 TPOT、H2O、AutoWEKA、auto-sklearn、AutoGluon 和 Google AutoML Tables 在内的公共及商业 AutoML 平台进行了广泛评估。在来自 Kaggle 和 OpenML AutoML Benchmark 的 50 个分类与回归任务套件上的测试表明,AutoGluon 更快、更鲁棒且准确得多。我们发现 AutoGluon 常常甚至优于其所有竞争对手在事后最佳组合的结果。在两个流行的 Kaggle 竞赛中,AutoGluon 仅在原始数据上训练 4 小时后便击败了 99% 的参赛数据科学家。
引用
@article{arxiv.2003.06505,
title = {AutoGluon-Tabular: Robust and Accurate AutoML for Structured Data},
author = {Nick Erickson and Jonas Mueller and Alexander Shirkov and Hang Zhang and Pedro Larroy and Mu Li and Alexander Smola},
journal= {arXiv preprint arXiv:2003.06505},
year = {2020}
}