中文

PTab:利用预训练语言模型建模表格数据

机器学习 2022-09-19 v1 人工智能

摘要

表格数据是信息时代的基础,已被广泛研究。近期研究表明,基于神经网络的模型能有效学习表格数据的上下文表示。有效的上下文表示学习需要有意义的特徵与大量数据。然而,当前方法常无法从缺乏语义信息的特徵中恰当学习上下文表示。此外,由于数据集间差异,通过混合表格数据集扩充训练集难以实现。为解决这些问题,我们提出一种新颖框架PTab,利用预训练语言模型(Pre-trained Language Model)建模表格数据。PTab通过三阶段处理学习表格数据的上下文表示:模态转换(MT)、掩码语言微调(MF)与分类微调(CF)。我们以在大规模语言数据上学习到语义信息的预训练模型(PTM)初始化模型,从而在微调阶段有效学习上下文表示。此外,我们可自然地混合文本化表格数据以扩充训练集,进一步提升表示学习。我们在八个流行表格分类数据集上评估PTab。实验结果表明,在有监督设定下我们的方法相较最先进基线(如XGBoost)取得了更好的平均AUC分数,并在半监督设定下优于对比方法。我们给出的可视化结果显示PTab具备良好的基于实例的可解释性。

关键词

引用

@article{arxiv.2209.08060,
  title  = {PTab: Using the Pre-trained Language Model for Modeling Tabular Data},
  author = {Guang Liu and Jie Yang and Ledell Wu},
  journal= {arXiv preprint arXiv:2209.08060},
  year   = {2022}
}