中文

Multi-CPR:面向段落检索的多领域中文数据集

信息检索 2022-04-26 v2 计算与语言

摘要

段落检索是信息检索(IR)研究中的一项基础任务,近来备受关注。在英语领域,大规模标注数据集(如 MS MARCO)的可用性和深度预训练语言模型(如 BERT)的出现使得现有段落检索系统得到显著改进。然而,在中文领域,特别是特定领域,由于质量标注数据集受规模限制,段落检索系统仍不成熟。因此,在本文中,我们提出了一个新颖的面向段落检索的多领域中文数据集(Multi-CPR)。该数据集收集自三个不同领域,包括电子商务、娱乐视频和医疗。每个数据集包含数百万段落和一定量人工标注的查询-段落相关对。我们实现了多种代表性段落检索方法作为基线。我们发现,在通用领域数据集上训练的检索模型在特定领域的性能不可避免地下降。尽管如此,基于领域内标注数据集构建的段落检索系统能取得显著提升,这确实证明了领域标注数据对于进一步优化是必要的。我们希望 Multi-CPR 数据集的发布能为中文特定领域段落检索任务提供基准,并推动未来研究进展。

关键词

引用

@article{arxiv.2203.03367,
  title  = {Multi-CPR: A Multi Domain Chinese Dataset for Passage Retrieval},
  author = {Dingkun Long and Qiong Gao and Kuan Zou and Guangwei Xu and Pengjun Xie and Ruijie Guo and Jian Xu and Guanjun Jiang and Luxi Xing and Ping Yang},
  journal= {arXiv preprint arXiv:2203.03367},
  year   = {2022}
}

备注

SIGIR 2022 Resource Track