ReSLLM:大语言模型是联邦搜索的强大资源选择器
信息检索
2024-02-01 v1 人工智能
摘要
联邦搜索涉及整合来自多个独立搜索引擎的结果,在为基于 LLM 的应用(如聊天机器人)提供支持的检索增强生成流水线中,其重要性将日益凸显。这些系统通常根据用户话语的性质,将查询分配给从专业(如 PubMed)到通用(如 Google)的各种搜索引擎。联邦搜索的一个关键方面是资源选择,即在发出查询之前选择适当的资源,以确保高质量和快速的响应,并控制调用外部搜索引擎的相关成本。然而,当前 SOTA 的资源选择方法主要依赖基于特征的学习方法。这些方法通常需要为每个资源进行劳动密集且昂贵的训练标签创建。相比之下,LLM 在 NLP 和 IR 任务中作为零样本方法展现出了强大的有效性。我们假设在联邦搜索的背景下,LLM 能够在不需要大量预定义标签或特征的情况下评估资源的相关性。在本文中,我们提出了 ReSLLM。我们的 ReSLLM 方法利用 LLM 在零样本设置下驱动联邦搜索中的资源选择。此外,我们设计了一种无监督微调协议,即合成标签增强微调(SLAT),其中使用现成的 LLM 预测先前记录的查询和来自资源片段的相关性,然后反过来利用其对 ReSLLM 进行资源选择方面的微调。我们的实证评估与分析详细说明了在此背景下影响 LLM 有效性的因素。结果展示了 ReSLLM 在资源选择方面的优势:不仅在零样本设置中具有竞争力的有效性,而且在使用 SLAT 协议进行微调后获得了大幅提升。
引用
@article{arxiv.2401.17645,
title = {ReSLLM: Large Language Models are Strong Resource Selectors for Federated Search},
author = {Shuai Wang and Shengyao Zhuang and Bevan Koopman and Guido Zuccon},
journal= {arXiv preprint arXiv:2401.17645},
year = {2024}
}