中文

AgenticRAGTracer:诊断智能体 RAG 中多步检索推理的跳跃感知基准

计算与语言 2026-02-24 v1

摘要

近年来,随着基于智能体的方法的快速发展,Agentic RAG 无疑成为重要的研究方向。而要求模型进行深思熟虑和多步交互的多跳推理,是评估此类能力的关键基准测试。然而,现有基准测试通常仅提供最终问题和答案,缺乏逐步连接原子问题至最终多跳查询的中间跳跃级别问题。这一限制阻碍了研究者在哪一步出现错误进行分析,限制了对模型能力的更细粒度评估。此外,大多数当前基准测试是手动构建的,既耗时耗力,又限制了可扩展性和泛化性。为此,我们引入 AgenticRAGTracer,首个主要由大语言模型自动构建、旨在支持逐步验证的 Agentic RAG 基准测试。本基准测试覆盖多个领域,包含 1,305 个数据点,与现有主流基准测试无交叠。广泛实验表明,即便是最先进的大语言模型在本数据集上也表现不佳。例如,GPT-5 在本数据集最难部分仅取得 22.6% 的准确率。跳跃感知诊断揭示,失败主要由扭曲的推理链所致——要么过早消亡,要么过度膨胀。这凸显了模型在任务逻辑结构中分配步骤方面的关键能力缺失,提供了传统评估所缺失的诊断维度。我们认为本工作将推动 Agentic RAG 领域的研究,并激发此区域进一步有意义的进展。我们的代码和数据已公开于 https://github.com/YqjMartin/AgenticRAGTracer。

关键词

引用

@article{arxiv.2602.19127,
  title  = {AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG},
  author = {Qijie You and Wenkai Yu and Wentao Zhang},
  journal= {arXiv preprint arXiv:2602.19127},
  year   = {2026}
}