中文

重新审视表格深度学习的预训练目标

机器学习 2022-07-13 v2

摘要

当前用于表格数据的深度学习模型已能与基于决策树的传统机器学习模型(GBDT)相竞争。与 GBDT 不同,深度模型还能额外受益于预训练,而预训练是视觉和自然语言处理领域深度学习的核心技术。针对表格问题,已有多种预训练方法被提出,但由于这些方法通常未进行相互比较,或比较仅限于最简单的 MLP 架构,因此预训练是否能带来持续且显著的提升以及应采用何种方法,目前尚不完全清楚。本文旨在确定可普遍应用于不同数据集和架构的表格深度学习模型预训练的最佳实践。我们的发现之一是,在预训练阶段使用目标标签有利于下游性能,并提倡几种目标感知的预训练目标。总体而言,我们的实验表明,正确执行的预训练能显著提升表格深度学习模型的性能,使其常常优于 GBDT。

关键词

引用

@article{arxiv.2207.03208,
  title  = {Revisiting Pretraining Objectives for Tabular Deep Learning},
  author = {Ivan Rubachev and Artem Alekberov and Yury Gorishniy and Artem Babenko},
  journal= {arXiv preprint arXiv:2207.03208},
  year   = {2022}
}

备注

Code: https://github.com/puhsu/tabular-dl-pretrain-objectives