什么破坏了基于知识图谱的 RAG?不完整知识下推理的基准测试与实证洞察
人工智能
2026-01-13 v4
摘要
基于知识图谱的检索增强生成 (KG-RAG) 是一种日益受到探索的方法,旨在将大型语言模型的推理能力与知识图谱的结构化证据相结合。然而,当前的评估实践存在不足:现有基准测试通常包含可直接利用知识图谱中现有三元组回答的问题,导致难以明确模型是在进行推理还是直接检索答案。此外,不一致的评估指标和宽松的答案匹配标准进一步模糊了有意义的比较。在本工作中,我们引入了一种构建基准测试的通用方法,并提出了 BRINK(不完整知识下推理基准测试),以系统性地评估知识不完整条件下的 KG-RAG 方法。我们的实证结果表明,当前的 KG-RAG 方法在知识缺失情况下的推理能力有限,往往依赖内部记忆,并且根据其设计表现出不同程度的泛化能力。
引用
@article{arxiv.2508.08344,
title = {What Breaks Knowledge Graph based RAG? Benchmarking and Empirical Insights into Reasoning under Incomplete Knowledge},
author = {Dongzhuoran Zhou and Yuqicheng Zhu and Xiaxia Wang and Hongkuan Zhou and Yuan He and Jiaoyan Chen and Steffen Staab and Evgeny Kharlamov},
journal= {arXiv preprint arXiv:2508.08344},
year = {2026}
}
备注
Accepted as a main conference paper at EACL 2026