中文

CSFCube —— 用于分面按例查询的计算机科学研究论文测试集

信息检索 2021-11-09 v3 计算与语言

摘要

按例查询是一种众所周知的信息检索任务,用户选择一篇文档作为搜索查询,目标是从大规模集合中检索相关文档。然而,一篇文档常覆盖主题的多个方面。为应对此情形,我们引入分面按例查询任务,其中用户除输入查询文档外还可指定更细粒度的方面。我们关注该任务在科学文献搜索中的应用。我们设想能够沿特定选择的修辞结构元素检索与查询科学论文类似的科学论文的模型,作为该问题的一个解决方案。本工作中,我们所称的“分面”的修辞结构元素指示科学论文的目标、方法或结果。我们引入并描述一个专家标注的测试集以评估训练用于执行该任务的模型。我们的测试集由来自计算语言学与机器学习会议的 50 篇英语查询文档的多样化集合组成。我们严格遵循 TREC 用于深度-k 池化(k = 100 或 250)的标注指南,所得数据集合由具有高标注一致性的分级相关性分数构成。在我们数据集上评估的当前最优模型显示出需在进一步工作中弥补的显著差距。我们的数据集可在此访问:https://github.com/iesl/CSFCube

关键词

引用

@article{arxiv.2103.12906,
  title  = {CSFCube -- A Test Collection of Computer Science Research Articles for Faceted Query by Example},
  author = {Sheshera Mysore and Tim O'Gorman and Andrew McCallum and Hamed Zamani},
  journal= {arXiv preprint arXiv:2103.12906},
  year   = {2021}
}

备注

Accepted to the NeurIPS 2021 Track on Datasets and Benchmarks