中文

Long$^2$RAG:基于关键点召回的长上下文与长形式检索增强生成评估

计算与语言 2025-01-28 v3

摘要

检索增强生成(RAG)是解决大型语言模型(LLMs)固定知识局限性的一种有前景的方法。然而,当前评估RAG系统的基准存在两个关键缺陷:(1)由于缺乏反映检索文档特征的数据集,它们未能充分衡量LLMs处理长上下文检索的能力;(2)它们缺乏一种全面的评估方法,用于评估LLMs生成能有效利用检索信息的长形式回复的能力。为了解决这些不足,我们引入了Long2^2RAG基准和关键点召回(KPR)指标。Long2^2RAG包含280个问题,涵盖10个领域和8个问题类别,每个问题关联5篇检索到的文档,平均长度为2,444个词。KPR评估LLMs将检索文档中提取的关键点融入其生成回复的程度,从而提供对其利用检索信息能力的更细致评估。

关键词

引用

@article{arxiv.2410.23000,
  title  = {Long$^2$RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point Recall},
  author = {Zehan Qi and Rongwu Xu and Zhijiang Guo and Cunxiang Wang and Hao Zhang and Wei Xu},
  journal= {arXiv preprint arXiv:2410.23000},
  year   = {2025}
}

备注

Accepted to EMNLP'24 (Findings). Camera-ready version