SubTab:用于自监督表示学习的表格数据特征子集划分
机器学习
2021-10-28 v2 机器学习
摘要
自监督学习已被证明在学习有用表示方面非常有效,然而其诸多成功是在图像、音频和文本等数据类型中取得的。这一成功主要是通过增强利用数据中的空间、时间或语义结构来实现的。然而,在医疗保健等领域常用的表格数据集中可能不存在此类结构,使得设计有效的增强方法变得困难,并阻碍了表格数据设置中的类似进展。在本文中,我们引入了一个新框架,即表格数据特征子集划分(SubTab),通过将输入特征划分为多个子集,将表格数据的学习任务转化为多视图表示学习问题。我们认为,在自编码器设置中从其特征子集而非其损坏版本重建数据,能更好地捕获其底层潜在表示。在该框架中,联合表示可表示为测试时各子集潜在变量的聚合,我们称之为协同推断。我们的实验表明,SubTab 在表格设置下的 MNIST 上达到了 98.31% 的最先进(SOTA)性能,与基于 CNN 的 SOTA 模型相当,并以显著优势超越其他三个真实世界数据集上的现有基线。
引用
@article{arxiv.2110.04361,
title = {SubTab: Subsetting Features of Tabular Data for Self-Supervised Representation Learning},
author = {Talip Ucar and Ehsan Hajiramezanali and Lindsay Edwards},
journal= {arXiv preprint arXiv:2110.04361},
year = {2021}
}
备注
NeurIPS 2021. Code can be found at https://github.com/AstraZeneca/SubTab