中文

OneStop QAMaker:一站式从文本中抽取问答对

计算与语言 2021-02-25 v1

摘要

大规模问答(QA)对对于推进机器阅读理解与问答等研究领域至关重要。从文档构建QA对需要确定如何提问以及对应答案。现有的QA对生成方法通常遵循流水线方式,即先选择最可能的候选答案片段,再生成该答案特定的问题。然而,这种流水线方式在从文档中挖掘最合适的QA对时并不理想,因为它忽略了问题生成与答案抽取的关联,可能导致不兼容的QA对生成,即所选答案片段不适合问题生成。而对于人工标注者,我们会整体考虑QA对并兼顾问题与答案的兼容性。受此启发,我们摒弃传统流水线方式,提出名为OneStop的模型,以一站式方法从文档生成QA对。具体而言,问题及其对应答案片段被同时抽取,且问题生成与答案抽取过程相互影响。此外,OneStop仅需单一模型即可解决复杂QA生成任务,在工业场景的训练与部署中更为高效。我们在三个大规模机器阅读理解数据集SQuAD、NewsQA和DuReader上进行了综合实验。实验结果表明,我们的OneStop模型在生成问题质量、生成问答对质量与模型效率方面均显著优于基线。

关键词

引用

@article{arxiv.2102.12128,
  title  = {OneStop QAMaker: Extract Question-Answer Pairs from Text in a One-Stop Approach},
  author = {Shaobo Cui and Xintong Bao and Xinxing Zu and Yangyang Guo and Zhongzhou Zhao and Ji Zhang and Haiqing Chen},
  journal= {arXiv preprint arXiv:2102.12128},
  year   = {2021}
}

备注

8 pages