中文

TAPEX:通过神经 SQL 执行器学习的表格预训练

计算与语言 2022-03-15 v3 人工智能

摘要

近期语言模型预训练借助大规模非结构化文本数据取得了巨大成功。然而,由于缺少大规模高质量表格数据,在结构化表格数据上应用预训练仍具挑战。本文提出 TAPEX,表明可通过在合成语料上学习一个神经 SQL 执行器来实现表格预训练,该语料由自动合成的可执行 SQL 查询及其执行输出获得。TAPEX 通过引导语言模型在多样、大规模且高质量的合成语料上模仿 SQL 执行器,解决了数据稀缺难题。我们在四个基准数据集上评估 TAPEX。实验结果表明,TAPEX 大幅优于以往的表格预训练方法,并在所有数据集上取得新的最先进结果。其中包括:弱监督 WikiSQL 语义解析准确率提升至 89.5%(+2.3%),WikiTableQuestions 语义解析准确率提升至 57.5%(+4.8%),SQA 语义解析准确率提升至 74.5%(+3.5%),以及 TabFact 准确率提升至 84.2%(+3.2%)。据我们所知,这是首项利用合成可执行程序进行表格预训练并在多种下游任务上取得新的最先进结果的工作。我们的代码见 https://github.com/microsoft/Table-Pretraining。

关键词

引用

@article{arxiv.2107.07653,
  title  = {TAPEX: Table Pre-training via Learning a Neural SQL Executor},
  author = {Qian Liu and Bei Chen and Jiaqi Guo and Morteza Ziyadi and Zeqi Lin and Weizhu Chen and Jian-Guang Lou},
  journal= {arXiv preprint arXiv:2107.07653},
  year   = {2022}
}

备注

ICLR 2022 camera ready version