大语言模型在 RDF 知识图创建与理解能力上的基准测试:LLM 对 Turtle 语法的掌握程度如何?
人工智能
2023-10-02 v1 计算与语言
数据库
摘要
大语言模型(LLMs)正快速发展,在自然语言处理和编程任务上取得显著进步。然而,它们处理表示数据的正式语言(特别是在知识图工程领域)的能力仍缺乏充分研究。为评估各类 LLM 的熟练度,我们创建了一组五项任务,以探查它们解析、理解、分析和创建以 Turtle 语法序列化的知识图的能力。这些任务各自具有不同复杂程度且可随问题规模扩展,已被集成进我们的自动化评估系统 LLM-KG-Bench。评估涵盖了四种商用 LLM——GPT-3.5、GPT-4、Claude 1.3 和 Claude 2.0,以及两种可自由获取的离线模型 GPT4All Vicuna 和 GPT4All Falcon 13B。该分析深入揭示了 LLM 在利用 Turtle 表示的 RDF 知识图工程工作流中应用的优势与不足。尽管结果表明最新商用模型在前代基础上的 Turtle 语言熟练度有所提升,但也暴露出明显弱点:这些模型在严格遵循输出格式约束(此情境下的关键要求)方面表现欠佳。
引用
@article{arxiv.2309.17122,
title = {Benchmarking the Abilities of Large Language Models for RDF Knowledge Graph Creation and Comprehension: How Well Do LLMs Speak Turtle?},
author = {Johannes Frey and Lars-Peter Meyer and Natanael Arndt and Felix Brei and Kirill Bulert},
journal= {arXiv preprint arXiv:2309.17122},
year = {2023}
}
备注
accepted for proceedings of DL4KG Workshop @ ISWC 2023 at ceur-ws.org