实性能提升有多显著?面向 GraphRAG 的无偏评估框架
计算与语言
2025-06-10 v1 人工智能
信息检索
摘要
通过从知识图谱中检索上下文,图基检索增强生成(GraphRAG)可提升大型语言模型(LLM)针对用户问题生成的答案质量。已提出多种 GraphRAG 方法并报告其在答案质量方面取得令人鼓舞的性能。然而,我们注意到当前 GraphRAG 的答案评估框架存在两个关键缺陷:与问题无关的查询以及评估偏差,可能导致对性能的偏置甚至错误结论。为此,我们提出了无偏评估框架,采用图文本联合生成问题以产生更贴合数据集的查询,并设计无偏评估程序以消除 LLM 基于答案评估中的偏差。我们将该无偏框架应用于评估 3 种代表性 GraphRAG 方法,发现其性能提升远比此前报告的要温和。尽管我们的评估框架仍可能存在缺陷,但其呼吁科学评估的做法,为 GraphRAG 研究奠定了坚实的基础。
引用
@article{arxiv.2506.06331,
title = {How Significant Are the Real Performance Gains? An Unbiased Evaluation Framework for GraphRAG},
author = {Qiming Zeng and Xiao Yan and Hao Luo and Yuhao Lin and Yuxiang Wang and Fangcheng Fu and Bo Du and Quanqing Xu and Jiawei Jiang},
journal= {arXiv preprint arXiv:2506.06331},
year = {2025}
}