中文

用锤子挤柠檬:AutoML 与表格深度学习在数据稀缺分类应用中的评估

机器学习 2024-05-14 v1 人工智能

摘要

许多行业领域面临小规模表格数据。在这种数据稀缺的情形下,目前尚不清楚简单基线模型与更复杂的机器学习方法(如利用元学习和集成)哪种能获得最佳性能。在 44 个样本量 \leq 500 的表格分类数据集上,我们发现 L2 正则化逻辑回归在大多数基准数据集上的性能与最先进的自动机器学习(AutoML)框架(AutoPrognosis、AutoGluon)以及即插即用的深度神经网络(TabPFN、HyperFast)相似。因此,我们建议在表格数据稀缺的应用中首先考虑逻辑回归,并为实践者提供后续方法选择的最佳实践。

关键词

引用

@article{arxiv.2405.07662,
  title  = {Squeezing Lemons with Hammers: An Evaluation of AutoML and Tabular Deep Learning for Data-Scarce Classification Applications},
  author = {Ricardo Knauer and Erik Rodner},
  journal= {arXiv preprint arXiv:2405.07662},
  year   = {2024}
}

备注

ICLR 2024 Workshop on Practical ML for Low Resource Settings