中文

深度表格学习综述

机器学习 2024-10-17 v1 人工智能

摘要

表格数据广泛用于医疗、金融和交通等行业,对深度学习而言具有独特挑战,由于其异构性和缺乏空间结构。本综述回顾了深度学习模型用于表格数据的演变,从早期的全连接网络(FCN)到TabNet、SAINT、TabTranSELU和MambaNet等先进架构。这些模型采用注意力机制、特征嵌入和混合架构来解决表格数据复杂性。TabNet使用顺序注意力进行实例级特征选择,提高可解释性;SAINT结合自注意力和样本间注意力来捕获跨特征和数据点的复杂相互作用,两者均推进了可扩展性并降低了计算开销。诸如TabTransformer和FT-Transformer等混合架构将注意力机制与多层感知器(MLP)集成,以处理分类和数值数据,FT-Transformer将transformer适用于表格数据集。研究继续在性能和效率之间寻求在大型数据集上的平衡。图基模型如GNN4TDL和GANDALF将神经网络与决策树或图结构结合,增强特征表示并通过先进正则化技术在小数据集上缓解过拟合。基于扩散的模型如Tabular Denoising Diffusion Probabilistic Model(TabDDPM)生成合成数据以解决数据稀缺问题,提高模型鲁棒性。类似TabPFN和Ptab的模型利用预训练语言模型,将迁移学习和自监督技术整合到表格任务中。本综述突出了关键进展,概述了在可扩展性、泛化和可解释性等多样化表格数据应用方面的未来研究方向。

关键词

引用

@article{arxiv.2410.12034,
  title  = {A Survey on Deep Tabular Learning},
  author = {Shriyank Somvanshi and Subasish Das and Syed Aaqib Javed and Gian Antariksa and Ahmed Hossain},
  journal= {arXiv preprint arXiv:2410.12034},
  year   = {2024}
}

备注

43 pages, 18 figures, 3 tables