中文

从合成数据训练问答模型

计算与语言 2020-02-25 v1 人工智能

摘要

问答生成是一种数据增强方法,旨在给定有限的人类标注数据的情况下改进问答(QA)模型。然而,合成问答对与人类生成的问答对之间仍存在显著差距。本工作旨在通过利用大型语言模型来缩小这一差距,并探讨模型规模、预训练模型质量、合成数据规模以及算法选择等多个因素。在SQuAD1.1问答任务上,我们仅使用合成问答对就取得了比单独使用SQuAD1.1训练集问题更高的准确率。在无法访问真实维基百科数据的情况下,我们从由83亿参数的GPT-2模型生成的合成语料库中合成问答对。在无法获得人类监督、仅能访问其他模型的情况下,我们能够在完全由模型生成的数据上训练最先进的问答网络,这些网络在SQuAD1.1开发集上取得了88.4的精确匹配(EM)和93.9的F1分数。我们进一步将我们的方法应用于SQuAD2.0,并显示出相比先前使用合成数据的工作在EM分数上有2.8的绝对提升。

关键词

引用

@article{arxiv.2002.09599,
  title  = {Training Question Answering Models From Synthetic Data},
  author = {Raul Puri and Ryan Spring and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2002.09599},
  year   = {2020}
}