MK-SQuIT:基于迭代模板填充的问题合成
计算与语言
2020-11-06 v1
摘要
这项工作的目标是创建一个框架,以尽可能少的人工输入来合成生成问题/查询对。这些数据集可用于训练机器翻译系统,将自然语言问题转换为查询,这是一种有用的工具,可实现对数据库信息更自然的访问。现有的数据集生成方法需要随数据集规模线性增长的人工输入,导致数据集较小。除了简短的初始配置任务外,我们系统的查询生成过程不需要任何人工输入。我们利用 WikiData(一个 RDF 三元组知识库)作为生成问题与查询主要内容的来源。通过使用多层问题模板,我们能够避开先前方法中由人工处理的一些最具挑战性的查询生成环节;人工无需在任何步骤修改、聚合、检查、标注或生成任何问题或查询。我们的系统易于配置到多个领域,并可被修改以生成英语以外的自然语言查询。我们还展示了一个跨越四个 WikiData 领域的 110,000 个问询/查询对的示例数据集。然后我们提出一个使用该数据集训练的基线模型,其在商业问答(QA)场景中展现出前景。
引用
@article{arxiv.2011.02566,
title = {MK-SQuIT: Synthesizing Questions using Iterative Template-filling},
author = {Benjamin A. Spiegel and Vincent Cheong and James E. Kaplan and Anthony Sanchez},
journal= {arXiv preprint arXiv:2011.02566},
year = {2020}
}
备注
10 pages, 6 figures