PIPE-RDF:面向企业的 RDF 基准测试的 LLM 辅助管道
数据库
2026-02-24 v1 人工智能
摘要
企业依赖 RDF 知识图谱和 SPARQL 通过自然语言界面暴露运营数据,但公共的 KGQA 基准测试并未反映专有模式、前缀或查询分布。我们提出 PIPE-RDF,一个包含反向查询、类别平衡模板生成、检索增强提示、去重及基于执行的验证与修复的三阶段管道,用于构建模式特定的 NL-SPARQL 基准测试。我们在固定模式的公司-位置切片(5000 家公司)上实现 PIPE-RDF,从公共 RDF 数据中生成覆盖九个类别的 450 对平衡问句-SPARQL 对。管道在修复后实现 100% 解析和执行有效性,各阶段的修复前有效性率为 96.5%-100%。我们报告实体多样性指标、模板覆盖率分析及成本划分,以支持部署规划。我们发布结构化制品(CSV/JSONL、日志、图表)及操作指标,以支持实际场景中的模型评估与系统规划。代码已公开于 https://github.com/suraj-ranganath/PIPE-RDF。
引用
@article{arxiv.2602.18497,
title = {PIPE-RDF: An LLM-Assisted Pipeline for Enterprise RDF Benchmarking},
author = {Suraj Ranganath},
journal= {arXiv preprint arXiv:2602.18497},
year = {2026}
}
备注
Conference submission