EnrichIndex:利用 LLM 离线增强检索索引
计算与语言
2025-04-07 v1 人工智能
信息检索
摘要
现有信息检索系统在目标文档语言与用户查询语言高度匹配的情况下表现出色。然而,现实世界中的检索系统常常需要隐式推理文档是否相关。例如,在检索技术性文本或表格时,其与用户查询的相关性可能通过特定术语或结构隐含地表达,而非显式地体现在内容中。大语言模型(LLM)凭借其推理能力,在识别此类隐含相关性方面具有巨大潜力。然而,当前由 LLM 增强的检索受限于高延迟和高计算成本,因为 LLM 通常在线为每个查询重新计算查询-文档相关性。为解决这一问题,我们提出 EnrichIndex,一种检索方法,它改为在离线阶段利用 LLM 构建语义增强的检索索引,在索引时对检索语料库中的所有文档执行一次遍历。此外,语义增强的索引可补充现有在线检索方法,提升 LLM 重排器的性能。我们在五个涉及段落和表格的检索任务上评估了 EnrichIndex,发现其优于强大的在线 LLM 检索系统,相较于强基线在 recall@10 上平均提升 11.7 个点,在 NDCG@10 上平均提升 10.6 个点。在 LLM 在线调用方面,其处理的 token 数减少了 293.3 倍,大幅降低了在线延迟和成本。总体而言,EnrichIndex 是利用 LLM 强大推理能力离线构建更好检索索引的有效方法。
引用
@article{arxiv.2504.03598,
title = {EnrichIndex: Using LLMs to Enrich Retrieval Indices Offline},
author = {Peter Baile Chen and Tomer Wolfson and Michael Cafarella and Dan Roth},
journal= {arXiv preprint arXiv:2504.03598},
year = {2025}
}
备注
Dataset and code are available at https://peterbaile.github.io/enrichindex/