中文

表格数据:深度学习并非你所需的一切

机器学习 2021-11-24 v2

摘要

解决现实数据科学问题的关键要素是选择要使用的模型类型。对于表格数据的分类与回归问题,通常推荐使用树集成模型(如 XGBoost)。然而,最近提出了几种用于表格数据的深度学习模型,声称在某些用例中优于 XGBoost。本文通过在各种数据集上将新的深度模型与 XGBoost 严格比较,探讨这些深度模型是否应作为表格数据的推荐选项。除了系统比较它们的性能外,我们还考虑了它们所需的调优与计算。我们的研究表明,XGBoost 在这些数据集上优于这些深度模型,包括提出深度模型的论文中所使用的数据集。我们还证明 XGBoost 需要的调优少得多。从积极的一面,我们展示了深度模型与 XGBoost 的集成在这些数据集上比单独的 XGBoost 表现更好。

关键词

引用

@article{arxiv.2106.03253,
  title  = {Tabular Data: Deep Learning is Not All You Need},
  author = {Ravid Shwartz-Ziv and Amitai Armon},
  journal= {arXiv preprint arXiv:2106.03253},
  year   = {2021}
}