中文

MS MARCO:一个人工生成的机器阅读理解数据集

计算与语言 2018-11-01 v3 信息检索

摘要

我们引入了一个大规模机器阅读理解数据集,将其命名为 MS MARCO。该数据集包含 1,010,916 个匿名化问题——采样自 Bing 的搜索查询日志——每个问题均带有一个人工生成的答案,以及 182,669 个完全由人工重写生成的答案。此外,该数据集包含 8,841,823 个段落——提取自 Bing 检索到的 3,563,535 个网页文档——为整理自然语言答案提供了必要信息。MS MARCO 数据集中的一个问题可能有多个答案,也可能根本没有答案。利用该数据集,我们提出了三个难度不同的任务: 预测给定一组上下文段落后问题是否可回答,并像人类一样提取和综合答案; 基于可结合问题和段落上下文理解的上下文段落,生成一个格式良好的答案(如果可能); 给定一个问题,对一组检索到的段落进行排序。该数据集的规模以及问题源自真实用户搜索查询的事实,使 MS MARCO 有别于其他知名的公开机器阅读理解和问答数据集。我们相信,该数据集的规模和真实世界特性使其对机器阅读理解和问答模型的基准测试极具吸引力。

关键词

引用

@article{arxiv.1611.09268,
  title  = {MS MARCO: A Human Generated MAchine Reading COmprehension Dataset},
  author = {Payal Bajaj and Daniel Campos and Nick Craswell and Li Deng and Jianfeng Gao and Xiaodong Liu and Rangan Majumder and Andrew McNamara and Bhaskar Mitra and Tri Nguyen and Mir Rosenberg and Xia Song and Alina Stoica and Saurabh Tiwary and Tong Wang},
  journal= {arXiv preprint arXiv:1611.09268},
  year   = {2018}
}