中文

S-Net:从答案抽取到答案生成的机器阅读理解方法

计算与语言 2018-01-03 v6

摘要

本文针对MS-MARCO数据集提出了一种新颖的机器阅读理解方法。与旨在用段落中精确文本片段回答问题的SQuAD数据集不同,MS-MARCO数据集将任务定义为从多个段落中回答问题,且答案中的词语不一定出现在段落中。因此,我们开发了一个先抽取后合成的框架,从抽取结果中合成答案。具体而言,首先使用答案抽取模型从段落中预测最重要的子片段作为证据,然后答案合成模型将这些证据作为附加特征,连同问题和段落一起,进一步加工生成最终答案。我们采用针对单段落阅读理解的最先进神经网络构建答案抽取模型,并提出了一个额外的段落排序任务来辅助多段落中的答案抽取。答案合成模型基于序列到序列神经网络,并以抽取的证据作为特征。实验表明,我们的先抽取后合成方法优于当前最先进的方法。

关键词

引用

@article{arxiv.1706.04815,
  title  = {S-Net: From Answer Extraction to Answer Generation for Machine Reading Comprehension},
  author = {Chuanqi Tan and Furu Wei and Nan Yang and Bowen Du and Weifeng Lv and Ming Zhou},
  journal= {arXiv preprint arXiv:1706.04815},
  year   = {2018}
}

备注

AAAI18