中文

ORCAS:用于搜索分析的1800万点击查询-文档对

信息检索 2020-08-19 v2 机器学习

摘要

网络搜索引擎的用户通过查询和点击揭示其信息需求,使得点击日志成为信息检索的有用资产。然而,点击日志因可能过度暴露个人或商业敏感信息,尚未公开发布供学术使用。本文描述了与TREC深度学习赛道文档语料库相关的点击数据发布。经过聚合与过滤(包括k-匿名性要求),我们发现TREC DL的140万个URL与1000万个不同查询有1800万条连接。我们的这些查询及与TREC文档连接的数据库,规模与先前关于查询挖掘与排序的论文中使用的专有数据集相近。我们使用点击数据增强TREC DL训练数据进行了一些初步实验,相较而言提供:多28倍的查询,多49倍连接至语料库中4.4倍多的URL。我们给出了数据集生成过程、特征、在排序中使用的描述,并建议其他潜在用途。

关键词

引用

@article{arxiv.2006.05324,
  title  = {ORCAS: 18 Million Clicked Query-Document Pairs for Analyzing Search},
  author = {Nick Craswell and Daniel Campos and Bhaskar Mitra and Emine Yilmaz and Bodo Billerbeck},
  journal= {arXiv preprint arXiv:2006.05324},
  year   = {2020}
}