重新思考深度学习中的表格数据数据增强
机器学习
2023-05-23 v2 人工智能
摘要
表格数据是机器学习(ML)中应用最广泛的数据格式。尽管基于树的方法在有监督学习中优于基于 DL 的方法,但近期文献报道,基于 Transformer 的自监督学习优于基于树的方法。在现有表格数据自监督学习文献中,对比学习是主流方法。在对比学习中,数据增强对于生成不同视图十分重要。然而,由于表格数据独特的结构与高复杂性,其数据增强一直较为困难。此外,现有方法通常将模型结构、自监督学习方法与数据增强三个主要组件一并提出。因此,先前工作未综合考量这些组件便比较性能,且各组件如何影响实际性能并不清晰。在本研究中,我们聚焦于数据增强以解决这些问题。我们提出一种新颖的数据增强方法,ask oken eplacement(),其将掩码词元替换为每个词元化列的一部分; 利用正成为表格数据主流基于 DL 架构的 Transformer 的特性,对各列嵌入执行数据增强。通过在 个多样化公开数据集上有监督与自监督学习场景下的实验,我们表明 相较现有数据增强方法取得了具竞争力的性能并提升了模型表现。此外,我们讨论了 最有效用的具体场景并界定其应用范围。代码见 https://github.com/somaonishi/MTR/。
引用
@article{arxiv.2305.10308,
title = {Rethinking Data Augmentation for Tabular Data in Deep Learning},
author = {Soma Onishi and Shoya Meguro},
journal= {arXiv preprint arXiv:2305.10308},
year = {2023}
}