中文

表格数据的深度学习:一种自监督方法

机器学习 2024-01-30 v1 人工智能

摘要

我们描述了一种使用TabTransformer模型结合自监督学习训练表格数据的新方法。传统的表格数据机器学习模型(如GBDT)被广泛使用,但我们的论文考察了TabTransformer(一种专门为表格数据优化的基于Transformer的模型)的有效性。TabTransformer通过利用Transformer的自注意力机制,捕捉表格数据中特征之间的复杂关系和依赖。我们在本研究中采用了自监督学习方法,其中TabTransformer通过创建代理监督任务从未标记数据中学习,从而消除了对标记数据的需求。目标是找到最有效的TabTransformer模型表示分类和数值特征的方法。为了解决在构建Transformer各种输入设置时面临的挑战,我们还进行了比较分析,以考察TabTransformer模型与基线模型(如MLP和监督TabTransformer)的性能。本研究提出了一种新方法,通过创建TabTransformer模型的多种变体(即Binned-TT、Vanilla-MLP-TT、MLP-based-TT),通过构建最优输入来更有效地捕捉表格数据集中各特征之间的潜在关系。此外,我们以基于掩码的无监督设置形式,对表格数据采用了自监督学习方法。研究结果揭示了表示分类和数值特征的最佳方式,强调了TabTransformer在与已建立的机器学习模型和其他自监督学习方法相比时的性能。

关键词

引用

@article{arxiv.2401.15238,
  title  = {Deep Learning with Tabular Data: A Self-supervised Approach},
  author = {Tirth Kiranbhai Vyas},
  journal= {arXiv preprint arXiv:2401.15238},
  year   = {2024}
}