中文

OmniTab:基于自然与合成数据预训练的小样本表格问答

计算与语言 2022-07-11 v1

摘要

表格中的信息可以作为文本的重要补充,使得基于表格的问答(QA)系统具有重大价值。处理表格的内在复杂性常常给模型设计和数据标注都带来额外负担。在本文中,我们旨在以最小的标注代价开发一个简单的基于表格的 QA 模型。鉴于基于表格的 QA 既需要问题与表格之间的对齐,又需要对多个表格元素执行复杂推理,我们提出了一种杂食性预训练方法,该方法利用自然和合成数据来赋予模型这两种 respective 能力。具体而言,给定自由可用的表格,我们利用检索将表格与相关自然句子配对以进行基于掩码的预训练,并通过转换从表格中采样的 SQL 来合成自然语言问题,以使用 QA 损失进行预训练。我们在小样本和全量设定下进行了大量实验,结果清晰地展示了我们的模型 OmniTab 的优越性,其中最佳多任务方法在 128-shot 和全量设定下分别取得了 16.2% 和 2.7% 的绝对提升,并在 WikiTableQuestions 上确立了新的 state-of-the-art。详细的消融和分析揭示了自然和合成数据的不同特性,为杂食性预训练的未来方向提供了启示。代码、预训练数据和预训练模型可在 https://github.com/jzbjyb/OmniTab 获取。

关键词

引用

@article{arxiv.2207.03637,
  title  = {OmniTab: Pretraining with Natural and Synthetic Data for Few-shot Table-based Question Answering},
  author = {Zhengbao Jiang and Yi Mao and Pengcheng He and Graham Neubig and Weizhu Chen},
  journal= {arXiv preprint arXiv:2207.03637},
  year   = {2022}
}

备注

NAACL 2022