中文

介绍 LETOR 4.0 数据集

信息检索 2013-06-12 v1

摘要

LETOR 是一个用于学习排序(LEarning TO Rank)研究的基准数据包,包含标准特征、相关性判断、数据划分、评估工具以及若干基线方法。1.0 版于 2007 年 4 月发布,2.0 版于 2007 年 12 月发布,3.0 版于 2008 年 12 月发布。本版本 4.0 于 2009 年 7 月发布。与以往版本截然不同(V3.0 是基于 V2.0 的更新,而 V2.0 是基于 V1.0 的更新),LETOR 4.0 是一个全新的发布版本。它使用了 Gov2 网页集合(约 2500 万页)以及来自 TREC 2007 和 TREC 2008 百万查询赛道(Million Query track)的两个查询集。我们将这两个查询集简称为 MQ2007 和 MQ2008。MQ2007 包含约 1700 个带有标注文档的查询,MQ2008 包含约 800 个带有标注文档的查询。如果您对这些数据集有任何问题或建议,请发送邮件至 [email protected]。我们的目标是使该数据集对社区可靠且有用。

关键词

引用

@article{arxiv.1306.2597,
  title  = {Introducing LETOR 4.0 Datasets},
  author = {Tao Qin and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:1306.2597},
  year   = {2013}
}