表格数据:深度学习并非你所需的一切
机器学习
2021-11-24 v2
摘要
解决现实数据科学问题的关键要素是选择要使用的模型类型。对于表格数据的分类与回归问题,通常推荐使用树集成模型(如 XGBoost)。然而,最近提出了几种用于表格数据的深度学习模型,声称在某些用例中优于 XGBoost。本文通过在各种数据集上将新的深度模型与 XGBoost 严格比较,探讨这些深度模型是否应作为表格数据的推荐选项。除了系统比较它们的性能外,我们还考虑了它们所需的调优与计算。我们的研究表明,XGBoost 在这些数据集上优于这些深度模型,包括提出深度模型的论文中所使用的数据集。我们还证明 XGBoost 需要的调优少得多。从积极的一面,我们展示了深度模型与 XGBoost 的集成在这些数据集上比单独的 XGBoost 表现更好。
引用
@article{arxiv.2106.03253,
title = {Tabular Data: Deep Learning is Not All You Need},
author = {Ravid Shwartz-Ziv and Amitai Armon},
journal= {arXiv preprint arXiv:2106.03253},
year = {2021}
}