中文

无需相关性标签的精确零样本稠密检索

信息检索 2022-12-21 v1 计算与语言

摘要

尽管稠密检索在各项任务与语言中均已被证明有效且高效,但在没有相关性标签可用时,构建有效的全零样本稠密检索系统仍然十分困难。在本文中,我们认识到了零样本学习与编码相关性的困难。相反,我们提出通过假设文档嵌入 (HyDE) 进行转换。给定一个查询,HyDE 首先零样本指令一个指令跟随语言模型(例如 InstructGPT)生成一个假设文档。该文档捕获了相关性模式,但并不真实,可能包含错误细节。然后,一个无监督对比学习编码器(例如 Contriever)将该文档编码为一个嵌入向量。该向量在语料库嵌入空间中确定一个邻域,在此基于向量相似性检索出相似的真实文档。这第二步将生成的文档锚定到实际语料库,利用编码器的稠密瓶颈过滤掉错误细节。我们的实验表明,HyDE 显著优于 SOTA 无监督稠密检索器 Contriever,并在各种任务(例如网页搜索、问答、事实验证)和语言(例如 sw、ko、ja)中表现出与微调检索器相当的强劲性能。

关键词

引用

@article{arxiv.2212.10496,
  title  = {Precise Zero-Shot Dense Retrieval without Relevance Labels},
  author = {Luyu Gao and Xueguang Ma and Jimmy Lin and Jamie Callan},
  journal= {arXiv preprint arXiv:2212.10496},
  year   = {2022}
}