中文

ReCO:面向观点的大规模中文阅读理解数据集

计算与语言 2020-06-23 v1

摘要

本文提出了 ReCO,一个由人工构建的面向观点的中文阅读理解数据集。ReCO 中的问题是向商业搜索引擎发出的基于观点的查询。段落由众包工作者提供,他们从检索到的文档中提取支持片段。最后,众包工作者给出了抽象式的“是/否/不确定”答案。ReCO 的发布包含 30 万个问题,据我们所知,这是中文阅读理解领域规模最大的数据集。ReCO 的一个显著特征是,除了原始上下文段落外,我们还提供了可直接用于回答问题的支持证据。质量分析表明了 ReCO 的挑战性,它需要各种类型的推理技能,如因果推断、逻辑推理等。在许多问答问题上表现优异的当前 QA 模型(如 BERT)在该数据集上仅达到 77% 的准确率,大幅落后于人类近 92% 的表现,表明 ReCO 对机器阅读理解提出了很好的挑战。代码和数据集可在 https://github.com/benywon/ReCO 免费获取。

关键词

引用

@article{arxiv.2006.12146,
  title  = {ReCO: A Large Scale Chinese Reading Comprehension Dataset on Opinion},
  author = {BingningWang and Ting Yao and Qi Zhang and Jingfang Xu and Xiaochuan Wang},
  journal= {arXiv preprint arXiv:2006.12146},
  year   = {2020}
}

备注

AAAI-2020 camera ready