中文

事实、获取、推理:统一检索增强生成评估

计算与语言 2025-01-28 v3

摘要

大型语言模型(LLM)在各种认知任务中展示出显著的性能提升。正在出现的一种应用是利用LLM增强检索增强生成(RAG)能力。这些系统需要LLM理解用户查询、检索相关信息并综合生成连贯且准确的响应。鉴于此类系统在现实世界部署的日益增长,全面评估变得至关重要。为此,我们提出FRAMES(Factuality, Retrieval, And reasoning MEasurement Set),一个高质量的评估数据集,旨在测试LLM提供事实性响应、评估检索能力以及评估生成最终答案所需的推理能力。虽然以前的工作提供了评估这些能力的孤立数据集和基准,但FRAMES提供了一个统一的框架,为LLM在端到端RAG情景下的性能提供更清晰的图景。我们的数据集包含具有挑战性的多跳问题,需要整合来自多个来源的信息。我们呈现的基线结果表明,即使是最先进的LLM在无检索的情况下也仅达到0.40的准确率。通过我们提出的多步骤检索管道,准确率显著提高,达到0.66(超过50%的改进)。我们希望我们的工作将帮助弥合评估差距并帮助开发更稳健且更具能力的RAG系统。

关键词

引用

@article{arxiv.2409.12941,
  title  = {Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation},
  author = {Satyapriya Krishna and Kalpesh Krishna and Anhad Mohananey and Steven Schwarcz and Adam Stambler and Shyam Upadhyay and Manaal Faruqui},
  journal= {arXiv preprint arXiv:2409.12941},
  year   = {2025}
}

备注

Annual Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics (NAACL), 2025