中文

基于完形填空翻译的无监督问答

计算与语言 2020-05-05 v2 人工智能 机器学习

摘要

获取问答(QA)的训练数据耗时耗力,且现有 QA 数据集仅覆盖有限的领域与语言。本文探究抽取式 QA 究竟在多大程度上真正需要高质量训练数据,并研究无监督抽取式 QA 的可行性。我们通过对上下文、问题与答案三元组进行无监督生成来解决该问题,随后利用这些三元组自动合成抽取式 QA 训练数据。为生成此类三元组,我们首先从大规模文档语料中采样随机上下文段落,再从这些段落中采样随机名词短语或命名实体提及作为答案。接着我们将上下文中的答案转换为“填空式”完形填空问题,最终将其翻译为自然语言问题。我们提出并比较了多种无监督的完形填空到自然语言问题翻译方法,包括使用自然问题与完形填空问题的非对齐语料训练无监督 NMT 模型,以及基于规则的方法。我们发现,现代 QA 模型仅使用合成训练数据便能出人意料地很好地回答人类问题。我们证明,在完全不使用 SQuAD 训练数据的情况下,我们的方法在 SQuAD v1 上取得 56.4 的 F1(当答案为命名实体提及时为 64.5 F1),优于早期的监督模型。

关键词

引用

@article{arxiv.1906.04980,
  title  = {Unsupervised Question Answering by Cloze Translation},
  author = {Patrick Lewis and Ludovic Denoyer and Sebastian Riedel},
  journal= {arXiv preprint arXiv:1906.04980},
  year   = {2020}
}

备注

To appear in ACL 2019