中文

使预训练语言模型在表格预测上表现出色

计算与语言 2024-03-13 v2 机器学习

摘要

深度神经网络(DNN)的迁移能力在图像和语言处理方面取得了显著进展。然而,由于表格之间的异构性,这种 DNN 优势在表格数据预测(例如回归或分类任务)上仍远未被充分利用。语言模型(LM)从不同领域浓缩知识,具备理解各种表格特征名称的能力,有望作为在不同表格和不同预测任务之间迁移知识的通用学习者,但其离散文本表示空间本质上与表格中的数值特征值不兼容。在本文中,我们提出了 TP-BERTa,一种专门为表格数据预测预训练的 LM。具体而言,一种新颖的相对幅度标记化方法将标量数值特征值转换为精细离散的高维 token,一种特征内注意力方法将特征值与相应的特征名称整合在一起。综合实验表明,我们预训练的 TP-BERTa 在表格 DNN 中性能领先,并在典型表格数据场景中与 Gradient Boosted Decision Tree 模型具有竞争力。

关键词

引用

@article{arxiv.2403.01841,
  title  = {Making Pre-trained Language Models Great on Tabular Prediction},
  author = {Jiahuan Yan and Bo Zheng and Hongxia Xu and Yiheng Zhu and Danny Z. Chen and Jimeng Sun and Jian Wu and Jintai Chen},
  journal= {arXiv preprint arXiv:2403.01841},
  year   = {2024}
}

备注

Accepted to ICLR 2024 as spotlight presentation (Notable Top 5%). OpenReview link is https://openreview.net/forum?id=anzIzGZuLi, codes will be available at https://github.com/jyansir/tp-berta