Long$^2$RAG:基于关键点召回的长上下文与长形式检索增强生成评估
计算与语言
2025-01-28 v3
摘要
检索增强生成(RAG)是解决大型语言模型(LLMs)固定知识局限性的一种有前景的方法。然而,当前评估RAG系统的基准存在两个关键缺陷:(1)由于缺乏反映检索文档特征的数据集,它们未能充分衡量LLMs处理长上下文检索的能力;(2)它们缺乏一种全面的评估方法,用于评估LLMs生成能有效利用检索信息的长形式回复的能力。为了解决这些不足,我们引入了LongRAG基准和关键点召回(KPR)指标。LongRAG包含280个问题,涵盖10个领域和8个问题类别,每个问题关联5篇检索到的文档,平均长度为2,444个词。KPR评估LLMs将检索文档中提取的关键点融入其生成回复的程度,从而提供对其利用检索信息能力的更细致评估。
引用
@article{arxiv.2410.23000,
title = {Long$^2$RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point Recall},
author = {Zehan Qi and Rongwu Xu and Zhijiang Guo and Cunxiang Wang and Hao Zhang and Wei Xu},
journal= {arXiv preprint arXiv:2410.23000},
year = {2025}
}
备注
Accepted to EMNLP'24 (Findings). Camera-ready version