利用生成式大语言模型进行合成查询变体的数据融合
信息检索
2024-11-07 v1
摘要
在信息检索(IR)实验中考虑查询方差有助于提升检索效果。特别是,基于不同主题相关查询的排序集成比基于单一查询的排序能检索到更好的结果。最近,经过指令微调的生成式大语言模型(LLM)在捕捉人类语言的各种不同任务上取得了改进。为此,本工作探索了利用经过指令微调的 LLM 生成的合成查询变体进行数据融合实验的可行性。更具体地说,我们提出了一种轻量级、无监督且成本高效的方法,利用原则性提示和数据融合技术。在我们的实验中,当提供有关主题的额外上下文信息时,LLM 产生了更有效的查询。此外,我们基于四个 TREC 新闻基准的分析表明,基于合成查询变体的数据融合显著优于单一查询的基线方法,并且也优于伪相关反馈方法。我们与社区公开分享了代码和查询数据集,作为后续研究的资源。
引用
@article{arxiv.2411.03881,
title = {Data Fusion of Synthetic Query Variants With Generative Large Language Models},
author = {Timo Breuer},
journal= {arXiv preprint arXiv:2411.03881},
year = {2024}
}
备注
The definitive version of record was published in SIGIR-AP '24