中文

MIMICS:用于搜索澄清的大规模数据集合

信息检索 2020-06-19 v1 计算与语言 机器学习

摘要

搜索澄清因其于搜索引擎中的应用近来备受关注,亦被认定为对话式信息搜寻系统的主要组成部分。尽管其重要,研究界仍感缺乏用于研究搜索澄清各方面的大规模数据。本文中,我们介绍 MIMICS,一个从 Bing 查询日志中采样的真实网页搜索查询的搜索澄清数据集集合。MIMICS 中每条澄清由 Bing 生产算法生成,包含一个澄清问题与至多五个候选答案。MIMICS 包含三个数据集:(1) MIMICS-Click 包含超过 40 万条唯一查询、其关联的澄清面板以及相应的聚合用户交互信号(即点击)。(2) MIMICS-ClickExplore 是一个探索数据,包含超过 6 万条唯一查询的聚合用户交互信号,每条具多个澄清面板。(3) MIMICS-Manual 包含超过 2 千条唯一真实搜索查询。该数据集中每个查询-澄清对均由至少三名受训标注者手动标注,包含针对澄清问题、候选答案集及每个候选答案落地结果页的分级质量标签。MIMICS 公开供研究使用,从而使研究者能够研究若干与搜索澄清相关的任务,包括澄清生成与选择、澄清的用户参与预测、澄清的点击模型,以及分析用户与搜索澄清的交互。

关键词

引用

@article{arxiv.2006.10174,
  title  = {MIMICS: A Large-Scale Data Collection for Search Clarification},
  author = {Hamed Zamani and Gord Lueck and Everest Chen and Rodolfo Quispe and Flint Luu and Nick Craswell},
  journal= {arXiv preprint arXiv:2006.10174},
  year   = {2020}
}