中文

MS MARCO Web Search:一个拥有数百万真实点击标签的大规模信息丰富网页数据集

信息检索 2024-05-14 v1

摘要

近期大型模型的突破突显了数据规模、标签和模态的关键重要性。本文介绍了 MS MARCO Web Search,即首个大规模信息丰富网页数据集,特点是拥有数百万条真实点击查询-文档标签。该数据集模拟了真实世界的网页文档和查询分布,为各种下游任务提供丰富信息,并鼓励研究人员在诸多领域进行研究,如通用端到端神经检索模型、通用嵌入模型以及具有大型语言模型的下一代信息访问系统。MS MARCO Web Search 提供了三个网页检索挑战任务,这些任务需要在机器学习和信息检索系统研究领域中进行创新。作为满足大规模、真实和丰富数据要求的第一个数据集,MS MARCO Web Search 为人工智能和系统研究的未来发展铺平了道路。MS MARCO Web Search 数据集可在 https://github.com/microsoft/MS-MARCO-Web-Search 获取。

关键词

引用

@article{arxiv.2405.07526,
  title  = {MS MARCO Web Search: a Large-scale Information-rich Web Dataset with Millions of Real Click Labels},
  author = {Qi Chen and Xiubo Geng and Corby Rosset and Carolyn Buractaon and Jingwen Lu and Tao Shen and Kun Zhou and Chenyan Xiong and Yeyun Gong and Paul Bennett and Nick Craswell and Xing Xie and Fan Yang and Bryan Tower and Nikhil Rao and Anlei Dong and Wenqi Jiang and Zheng Liu and Mingqin Li and Chuanjie Liu and Zengzhong Li and Rangan Majumder and Jennifer Neville and Andy Oakley and Knut Magne Risvik and Harsha Vardhan Simhadri and Manik Varma and Yujing Wang and Linjun Yang and Mao Yang and Ce Zhang},
  journal= {arXiv preprint arXiv:2405.07526},
  year   = {2024}
}

备注

10 pages, 6 figures, for associated dataset, see http://github.com/microsoft/MS-MARCO-Web-Search