中文

实性能提升有多显著?面向 GraphRAG 的无偏评估框架

计算与语言 2025-06-10 v1 人工智能 信息检索

摘要

通过从知识图谱中检索上下文,图基检索增强生成(GraphRAG)可提升大型语言模型(LLM)针对用户问题生成的答案质量。已提出多种 GraphRAG 方法并报告其在答案质量方面取得令人鼓舞的性能。然而,我们注意到当前 GraphRAG 的答案评估框架存在两个关键缺陷:与问题无关的查询以及评估偏差,可能导致对性能的偏置甚至错误结论。为此,我们提出了无偏评估框架,采用图文本联合生成问题以产生更贴合数据集的查询,并设计无偏评估程序以消除 LLM 基于答案评估中的偏差。我们将该无偏框架应用于评估 3 种代表性 GraphRAG 方法,发现其性能提升远比此前报告的要温和。尽管我们的评估框架仍可能存在缺陷,但其呼吁科学评估的做法,为 GraphRAG 研究奠定了坚实的基础。

关键词

引用

@article{arxiv.2506.06331,
  title  = {How Significant Are the Real Performance Gains? An Unbiased Evaluation Framework for GraphRAG},
  author = {Qiming Zeng and Xiao Yan and Hao Luo and Yuhao Lin and Yuxiang Wang and Fangcheng Fu and Bo Du and Quanqing Xu and Jiawei Jiang},
  journal= {arXiv preprint arXiv:2506.06331},
  year   = {2025}
}