LLM-KG-Bench 3.0:指引语义技术能力在海量 LLM 中的定位
人工智能
2025-06-03 v1 计算与语言
数据库
摘要
当前的大型语言模型(LLM)能够辅助开发程序代码等众多任务,但它们是否能够良好地支持知识图谱(KG)的工作?哪个 LLM 在语义网和知识图谱工程(KGE)领域提供最佳能力?是否可以不通过手动检查大量答案来确定这些问题?LLM-KG-Bench 框架第 3.0 版本旨在回答这些问题。该框架包含一套可扩展的任务集合,用于自动评估 LLM 的答案,涵盖语义技术工作的不同方面。本文介绍了第 3 版的 LLM-KG-Bench 框架,以及使用该框架生成的提示词、答案和评估数据集,以及多个最新开源和商业 LLM。自首次发布以来,框架已进行显著增强,包括更新的任务 API 以更灵活地处理评估任务、修订的任务以及通过 vllm 库等等方面的扩展支持。使用超过 30 个当代开源和商业 LLM 生成了全面的数据集,使能够创建示例模型卡,展示模型在处理 RDF 和 SPARQL 方面的能力,以及在 Turtle 和 JSON-LD RDF 序列化任务上的性能比较。
引用
@article{arxiv.2505.13098,
title = {LLM-KG-Bench 3.0: A Compass for SemanticTechnology Capabilities in the Ocean of LLMs},
author = {Lars-Peter Meyer and Johannes Frey and Desiree Heim and Felix Brei and Claus Stadler and Kurt Junghanns and Michael Martin},
journal= {arXiv preprint arXiv:2505.13098},
year = {2025}
}
备注
Peer reviewed publication at ESWC 2025 Resources Track