基于 Transformer 的表格数据建模比较分析:以工业规模数据集为例
机器学习
2023-11-27 v1 人工智能
摘要
我们对专为表格数据建模设计的基于 Transformer 的模型进行了比较分析,特别是在一个工业规模数据集上。尽管早期研究在较小的公共或合成数据集上展示了有前景的结果,但其有效性并未扩展到更大的工业规模数据集。所识别的挑战包括处理高维数据、需要对类别和数值特征进行高效预处理,以及应对巨大的计算需求。为克服所识别的挑战,本研究使用合成数据集和来自 American Express 的默认预测 Kaggle 数据集(2022)对多种基于 Transformer 的模型进行了广泛考察。本文给出了关于最优数据预处理的关键见解,比较了预训练与直接监督学习方法,讨论了管理类别和数值特征的策略,并强调了计算资源与性能之间的权衡。聚焦于时间金融数据建模,本研究旨在促进基于 Transformer 的模型在真实场景中的系统性开发与部署,强调可扩展性。
引用
@article{arxiv.2311.14335,
title = {Comparative Analysis of Transformers for Modeling Tabular Data: A Casestudy using Industry Scale Dataset},
author = {Usneek Singh and Piyush Arora and Shamika Ganesan and Mohit Kumar and Siddhant Kulkarni and Salil R. Joshi},
journal= {arXiv preprint arXiv:2311.14335},
year = {2023}
}
备注
Accepted at 7th Joint International Conference on Data Science & Management of Data (11th ACMIKDD CODS and 29th COMAD)