CReSt:面向结构化文档复杂推理的检索增强生成综合基准
计算与语言
2025-05-26 v1
摘要
大型语言模型(LLM)近年来取得了显著进展,但评估其在实际检索增强生成(RAG)场景中的能力仍具有挑战。在实际应用中,LLM 必须展示复杂推理能力,恰当地拒绝回答问题,提供精确的引用,并有效地理解文档布局。这些能力对于高级任务处理、不确定性意识、保持可靠性和结构化理解至关重要。虽然一些先前工作分别解决了这些方面,但需要统一的框架来在实际 RAG 场景中对这些方面进行综合评估。为此,我们提出CReSt(面向结构化文档复杂推理的检索增强生成综合基准),旨在整体性地评估这些关键维度。CReSt 包含 2,245 组人工标注的英文和韩文示例,旨在捕捉需要对结构化文档进行复杂推理的实际 RAG 场景。它还引入了针对这些关键领域的全面评估方法。我们的评估显示,甚至是最先进的 LLM 在这些维度上也难以稳健地表现,凸显了需要改进的关键领域。我们发布CReSt以支持进一步的研究和开发更健壮的 RAG 系统。数据集和代码均可在 https://github.com/UpstageAI/CReSt 获取。
引用
@article{arxiv.2505.17503,
title = {CReSt: A Comprehensive Benchmark for Retrieval-Augmented Generation with Complex Reasoning over Structured Documents},
author = {Minsoo Khang and Sangjun Park and Teakgyu Hong and Dawoon Jung},
journal= {arXiv preprint arXiv:2505.17503},
year = {2025}
}