基于 LLM 的检索器值得其成本吗?效率、鲁棒性与推理开销的实证研究
信息检索
2026-04-07 v1
摘要
大型语言模型检索器在复杂查询上可提升性能,但其实际价值取决于效率、鲁棒性以及可靠的置信信号(除准确率外)。我们在12个任务、14个检索器上复现了推理密集型检索基准(BRIGHT),并扩展了评估,包括冷启动索引成本、查询延迟分布和吞吐量、语料库规模、受控查询扰动的鲁棒性,以及置信度使用(AUROC)用于预测查询成功。我们还通过将标准查询与五个提供的推理增强变体进行比较,量化了推理开销,测量准确率提升相对于添加延迟的比例。我们发现,一些专注于推理的检索器在有效性上取得佳绩,同时在吞吐量方面保持具竞争力,而多个大型 LLM 双编码器则为有限的性能提升付出了高额的延迟成本。推理增强对 sub-1B 编码器产生最小的延迟,但对顶级检索器则表现出最小收益,且可能在形式数学/代码领域中降低性能。置信度校准在各模型家族中始终表现较差,表明在无需额外校准的情况下,原始检索得分不可靠用于下游路由。我们发布了所有代码和构件以便可重复性。
引用
@article{arxiv.2604.03676,
title = {Are LLM-Based Retrievers Worth Their Cost? An Empirical Study of Efficiency, Robustness, and Reasoning Overhead},
author = {Abdelrahman Abdallah and Jamie Holdcroft and Mohammed Ali and Adam Jatowt},
journal= {arXiv preprint arXiv:2604.03676},
year = {2026}
}
备注
Accepted at SIGIR 2026