中文

TripClick:大型健康网络搜索引擎的日志文件

信息检索 2021-04-29 v2

摘要

点击日志是多种信息检索 (IR) 任务的宝贵资源。这包括查询理解/分析,以及学习有效的 IR 模型,尤其在模型需要大量训练数据时。我们发布了一个大规模领域特定的点击日志数据集,来源于 Trip Database 健康网络搜索引擎的用户交互。我们的点击日志数据集包含 2013 至 2020 年间收集的约 520 万次用户交互。我们利用该数据集创建标准 IR 评测基准——TripClick——含约 70 万条唯一自由文本查询与 130 万对查询-文档相关性信号,其相关性由两种点击通过模型估计。因此,该集合是为数不多提供必要数据丰富度与规模以训练具有大量参数的神经 IR 模型的数据集,并且显然是健康领域首个此类数据集。利用 TripClick,我们开展实验评估多种 IR 模型,展示了利用该数据训练神经架构的益处。特别地,评估结果表明,表现最佳的神经 IR 模型相对经典 IR 模型性能大幅提升,尤其对更频繁的查询。

关键词

引用

@article{arxiv.2103.07901,
  title  = {TripClick: The Log Files of a Large Health Web Search Engine},
  author = {Navid Rekabsaz and Oleg Lesota and Markus Schedl and Jon Brassey and Carsten Eickhoff},
  journal= {arXiv preprint arXiv:2103.07901},
  year   = {2021}
}

备注

Accepted at SIGIR 2021