评估RAG系统中多跳推理:LLM基 retriever 评估策略比较
信息检索
2026-04-21 v1 人工智能
摘要
检索增强生成(RAG)通过外部知识增强大型语言模型(LLM)以更准确地回答问题。然而,关于评估RAG系统—特别是检索器组件—的研究仍有限,因为大多数现有工作聚焦于单上下文检索,而非多跳查询,后者中单个上下文在孤立时可能显得无关紧要,但在组合后却至关重要。本研究使用HotPotQA、MuSiQue和SQuAD数据集模拟RAG系统,比较三种LLM作为评判者的评估策略,包括我们提出的上下文感知检索器评估(Care)。我们的目标是更好地理解如何在RAG系统中有效评估多跳推理。来自OpenAI、Meta和Google的LLM实验表明,Care始终优于现有方法,用于评估RAG系统中的多跳推理。性能提升在参数更大的模型和更长的上下文窗口中最为显著,而单跳查询对上下文感知评估的灵敏度最小。总体而言,结果凸显了在提高RAG系统可靠性和准确性方面,特别是在复杂查询场景中,上下文感知评估的关键作用。为确保可重复性,我们提供了实验数据的完整数据集 https://github.com/lorenzbrehme/CARE。
引用
@article{arxiv.2604.18234,
title = {Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies},
author = {Lorenz Brehme and Thomas Ströhle and Ruth Breu},
journal= {arXiv preprint arXiv:2604.18234},
year = {2026}
}
备注
15 Pages, Accepted for publication at the SynIRgy Workshop, ECIR 2026 (48th European Conference on Information Retrieval)