中文

TaBERT:用于文本与表格数据联合理解的预训练模型

计算与语言 2020-05-19 v1 机器学习

摘要

近年来,用于基于文本的自然语言(NL)理解任务的预训练语言模型(LM)蓬勃发展。此类模型通常在自由形式 NL 文本上训练,因此可能不适合诸如结构化数据上的语义解析等任务,这些任务需要对自由形式 NL 问题和结构化表格数据(例如数据库表)进行推理。本文中我们提出 TaBERT,一种联合学习 NL 句子与(半)结构化表格表示的预训练 LM。TaBERT 在包含 2600 万张表格及其英文语境的大规模语料上训练。在实验中,使用 TaBERT 作为特征表示层的神经语义解析器在具有挑战性的弱监督语义解析基准 WikiTableQuestions 上取得了新的最佳结果,同时在文本到 SQL 数据集 Spider 上表现具有竞争力。模型实现将发布于 http://fburl.com/TaBERT 。

关键词

引用

@article{arxiv.2005.08314,
  title  = {TaBERT: Pretraining for Joint Understanding of Textual and Tabular Data},
  author = {Pengcheng Yin and Graham Neubig and Wen-tau Yih and Sebastian Riedel},
  journal= {arXiv preprint arXiv:2005.08314},
  year   = {2020}
}

备注

To Appear at ACL 2020