中文

诊断与解决 KG-RAG 数据集中的陷阱:迈向更可靠的基准测试

计算与语言 2025-11-05 v4 人工智能 机器学习

摘要

知识图谱问答(KGQA)系统依赖高质量基准测试来评估复杂的多跳推理。然而,尽管被广泛使用,WebQSP 和 CWQ 等流行数据集却存在严重的质量问题,包括不准确或不完整的真值标注、构造不良(存在歧义、琐碎或无法回答)的问题,以及过时或不一致的知识。通过对包括 WebQSP 和 CWQ 在内的 16 个流行 KGQA 数据集进行人工审核,我们发现平均事实正确率仅为 57%。为解决这些问题,我们引入了 KGQAGen,这是一个系统性地解决这些陷阱的 LLM-in-the-loop 框架。KGQAGen 结合了结构化知识基础、LLM 引导的生成与符号验证,以生成具有挑战性且可验证的问答实例。利用 KGQAGen,我们构建了 KGQAGen-10k,一个基于 Wikidata 的万级规模基准测试,并评估了一组多样化的 KG-RAG 模型。实验结果表明,即使是最先进的系统在此基准测试上也表现挣扎,凸显了其揭示现有模型局限性的能力。我们的发现提倡更严格的基准构建,并将 KGQAGen 定位为推进 KGQA 评估的可扩展框架。

关键词

引用

@article{arxiv.2505.23495,
  title  = {Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking},
  author = {Liangliang Zhang and Zhuorui Jiang and Hongliang Chi and Haoyang Chen and Mohammed Elkoumy and Fali Wang and Qiong Wu and Zhengyi Zhou and Shirui Pan and Suhang Wang and Yao Ma},
  journal= {arXiv preprint arXiv:2505.23495},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 Datasets and Benchmarks Track