中文

CypherBench:在大语言模型时代实现对完整现代知识图谱的精准检索

计算与语言 2025-04-08 v2 人工智能 数据库

摘要

从图数据进行检索对于增强大语言模型(LLM)既有领域知识和私有企业数据至关重要,也是近期 GraphRAG 系统(edge 等,2024)的关键组件。尽管数十年来关于知识图谱和知识库问答方面的研究已有所为,但领先的 LLM 框架(如 Langchain 和 LlamaIndex)仅对现代百科全书式知识图谱(如 Wikidata)提供最小化的检索支持。本文分析了根本原因,建议现代 RDF 知识图谱(如 Wikidata、Freebase)因模式过大远超典型 LLM 上下文窗口、使用资源标识符、关系类型重叠且缺乏规范化而对 LLM 不够高效。作为解决方案,我们在底层 RDF 图之上提出属性图视图,可通过 Cypher 高效检索。我们在 Wikidata 上实现了这一想法,引入 CypherBench——首个包含 11 个大规模多域属性图、780 万实体及超 1 万问题的基准测试。为此,我们克服了若干关键挑战,包括开发 RDF 到属性图的转换引擎、构建文本到 Cypher 任务生成系统性管线以及设计新评估指标。

关键词

引用

@article{arxiv.2412.18702,
  title  = {CypherBench: Towards Precise Retrieval over Full-scale Modern Knowledge Graphs in the LLM Era},
  author = {Yanlin Feng and Simone Papicchio and Sajjadur Rahman},
  journal= {arXiv preprint arXiv:2412.18702},
  year   = {2025}
}