中文

TREC 2019 深度学习赛道概述

信息检索 2020-03-19 v2 计算与语言 机器学习

摘要

深度学习赛道是 TREC 2019 的新赛道,旨在研究大数据 regime 下的 ad hoc 排序。它是首个拥有大型人工标注训练集的赛道,引入了对应两项任务的两组数据,每项均配有严谨的 TREC 风格盲评与可复用测试集。文档检索任务的语料包含 320 万篇文档与 36.7 万条训练查询,我们据此生成了含 43 条查询的可复用测试集。段落检索任务的语料包含 880 万段段落与 50.3 万条训练查询,我们据此生成了含 43 条查询的可复用测试集。今年 15 个小组共提交了 75 次运行,使用了深度学习、迁移学习与传统 IR 排序方法的多种组合。深度学习运行显著优于传统 IR 运行。对此结果的一种可能解释是,我们引入了大型训练数据,并在评判池(judging pools)中纳入了基于此数据训练的深度模型,而以往一些研究既无此类训练数据,也未采用此类池化。

关键词

引用

@article{arxiv.2003.07820,
  title  = {Overview of the TREC 2019 deep learning track},
  author = {Nick Craswell and Bhaskar Mitra and Emine Yilmaz and Daniel Campos and Ellen M. Voorhees},
  journal= {arXiv preprint arXiv:2003.07820},
  year   = {2020}
}