中文

表格数据的注意力与对比学习——以数据为中心的基准测试

机器学习 2024-01-10 v1

摘要

尽管在图像和文本学习方面取得了突破性成功,但深度学习在处理表格数据时并未取得比传统机器学习(ML)显著的改进。这种性能差距凸显了以数据为中心的处理和基准测试学习算法的必要性。最近,注意力和对比学习的突破已经改变了计算机视觉和自然语言处理范式。然而,这些先进深度模型在表格数据上的有效性仅通过少量具有非常大样本量的数据集进行了稀疏研究,并且在有限数量的基线基准测试后报告了混合的发现。我们认为,文献中表格数据集的异质性和选择性基线可能会使基准测试结果产生偏差。本文在广泛选择的28个表格数据集(14个易分类和14个难分类)上,针对传统深度学习和机器学习,全面评估了最先进的注意力和对比学习方法。我们以数据为中心的基准测试表明,何时传统ML优于深度学习,反之亦然,因为不存在对所有表格数据集都最佳的学习方法。结合样本间和特征间的注意力,以显著优势战胜了在表格数据集上不可战胜的传统ML,但在高维数据上失败,而对比学习则取得了稳健的领先。虽然混合注意力-对比学习策略在难分类数据集上大多获胜,但在具有可能更简单决策边界的易分类数据集上,传统方法通常更优。据我们所知,这是第一篇对注意力和对比学习在多样化表格数据集上的性能进行统计分析,并与传统深度学习和机器学习基线进行比较的基准测试论文,以促进该领域的进一步进展。

关键词

引用

@article{arxiv.2401.04266,
  title  = {Attention versus Contrastive Learning of Tabular Data -- A Data-centric Benchmarking},
  author = {Shourav B. Rabbani and Ivan V. Medri and Manar D. Samad},
  journal= {arXiv preprint arXiv:2401.04266},
  year   = {2024}
}