中文

SPARQL-LLM:从自然语言问题生成实时SPARQL查询

信息检索 2025-12-17 v1 人工智能 计算与语言

摘要

大型语言模型的出现正在推动 novel approaches 不断涌现,这些方法有望更好地应对从自然语言生成结构化查询(如SPARQL查询)的挑战。然而,这些新方法大多 focus response accuracy over a single source,同时忽略了其他评估标准,如分布式数据存储上的联邦查询能力,以及生成SPARQL查询的运行时和成本。因此,这些方法往往 not production-ready 或难以部署在(可能是联邦化)知识图谱上以获得良好准确率。为缓解此问题,本文扩展了我们的前期工作,描述并系统评估了SPARQL-LLM,一种开源且与三元存储无关的 approach,由轻量级 metadata 提供动力,能够从自然语言文本生成SPARQL查询。首先,我们描述了其体系结构,包括用于 metadata 索引、提示构建和查询生成与执行的 dedicated components。然后,我们基于 state-of-the-art 挑战(包含多语言问题),以及来自生物信息学领域三大最常用知识图谱的 question collection 进行评估。我们的结果表明,在 state-of-the-art 挑战上 F1 分数提升了 24%,对高资源语言(如英语和西班牙语)具有适应性,能够形成复杂且联邦化的生物信息学查询。此外,我们展示了SPARQL-LLM 在挑战中其他系统的 36倍 速度,同时每题最高仅需 $0.01 的成本,使其适用于实时、低成本的文本到SPARQL 应用。一种可部署在真实世界去中心化知识图谱上的应用可在 https://www.expasy.org/chat 找到。

关键词

引用

@article{arxiv.2512.14277,
  title  = {SPARQL-LLM: Real-Time SPARQL Query Generation from Natural Language Questions},
  author = {Panayiotis Smeros and Vincent Emonet and Ruijie Wang and Ana-Claudia Sima and Tarcisio Mendes de Farias},
  journal= {arXiv preprint arXiv:2512.14277},
  year   = {2025}
}

备注

17 pages, 8 figures, 1 table. Under Review