中文

皆为相对!——一种用于改进零样本相关性预测的合成查询生成方法

计算与语言 2023-11-15 v1

摘要

大语言模型(LLMs)近期的发展展现出通过少至 8 个示例提示来生成合成查询-文档对的能力前景。这使得构建更优 IR 模型成为可能,尤其对于无现成训练数据的任务。典型地,此类合成查询生成(QGen)方法以输入上下文(如文本文档)为条件生成与该上下文相关的查询,或额外以相关性标签(如相关 vs 不相关)为条件跨相关性桶生成查询。然而,我们发现此类 QGen 方法非最优,因其要求模型从少量示例中推理出期望标签与输入。本工作中,我们提议通过同时为不同标签生成查询来减轻 LLMs 的这一负担。我们假设,相较于要求模型给定输入上下文生成例如不相关查询,要求模型生成相对于相关查询的不相关查询,对模型而言是更简易的任务设定。跨七个 IR 数据集的广泛实验表明,以此方式生成的合成查询转化为更优的下游性能,意味着所生成查询确实具有更高质量。

关键词

引用

@article{arxiv.2311.07930,
  title  = {It's All Relative! -- A Synthetic Query Generation Approach for Improving Zero-Shot Relevance Prediction},
  author = {Aditi Chaudhary and Karthik Raman and Michael Bendersky},
  journal= {arXiv preprint arXiv:2311.07930},
  year   = {2023}
}

备注

18 pages