中文

HAGRID:用于带归因生成式信息检索的人与 LLM 协作数据集

计算与语言 2023-08-01 v1 信息检索

摘要

大语言模型(LLMs)的兴起对搜索产生了变革性影响,开创了能够用自然语言文本生成搜索结果并附带来源引用以支持性文献的新一代搜索引擎时代。构建生成式信息检索模型需要公开可访问的数据集,而目前此类数据集仍然匮乏。本文介绍一个新数据集 HAGRID(Human-in-the-loop Attributable Generative Retrieval for Information-seeking Dataset,面向信息检索的带人环可归因生成式检索数据集),用于构建能够检索候选引文并生成带归因解释的端到端生成式信息检索模型。与近期聚焦于对黑盒专有搜索引擎进行人工评估的工作不同,我们的数据集构建于公开可用的信息检索数据集 MIRACL 的英文子集之上。HAGRID 基于人与 LLM 的协作构建:我们首先使用 LLM(即 GPT-3.5)自动收集遵循上下文引用风格的带归因解释;随后,我们请人工标注者基于信息量和可归因性两项标准对 LLM 解释进行评估。HAGRID 可作为开发具有更优归因能力的信息检索模型的催化剂。

关键词

引用

@article{arxiv.2307.16883,
  title  = {HAGRID: A Human-LLM Collaborative Dataset for Generative Information-Seeking with Attribution},
  author = {Ehsan Kamalloo and Aref Jafari and Xinyu Zhang and Nandan Thakur and Jimmy Lin},
  journal= {arXiv preprint arXiv:2307.16883},
  year   = {2023}
}

备注

Data released at https://github.com/project-miracl/hagrid