中文

DuReader_retrieval:一个面向网页搜索引擎段落检索的大规模中文基准

计算与语言 2022-11-16 v4 信息检索

摘要

本文提出了DuReader_retrieval,一个用于段落检索的大规模中文数据集。DuReader_retrieval包含来自一个商业搜索引擎的超过9万个查询和超过800万个唯一段落。为了缓解其他数据集的不足并确保我们基准的质量,我们(1)通过人工标注来自多个检索器汇聚的结果,减少了开发集和测试集中的假阴性,以及(2)移除了与开发和测试查询语义相似的训练查询。此外,我们提供了两个领域外测试集用于跨领域评估,以及一组人工翻译的查询用于跨语言检索评估。实验表明,DuReader_retrieval具有挑战性,许多问题仍未解决,例如显著短语不匹配以及查询与段落之间的句法不匹配。这些实验还表明,稠密检索器在跨领域泛化方面表现不佳,且跨语言检索本质上极具挑战性。DuReader_retrieval已公开于https://github.com/baidu/DuReader/tree/master/DuReader-Retrieval。

关键词

引用

@article{arxiv.2203.10232,
  title  = {DuReader_retrieval: A Large-scale Chinese Benchmark for Passage Retrieval from Web Search Engine},
  author = {Yifu Qiu and Hongyu Li and Yingqi Qu and Ying Chen and Qiaoqiao She and Jing Liu and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2203.10232},
  year   = {2022}
}

备注

EMNLP 2022, 13 pages