评估 LLM 在知识图谱补全中的适用性
计算与语言
2024-07-19 v2 人工智能
摘要
最近的工作表明,大型语言模型(LLM)有能力解决与知识图谱相关的任务,例如知识图谱补全,甚至在零样本或少样本范式下也是如此。然而,已知它们会产生幻觉答案,或以非确定性的方式输出结果,从而导致推理错误的响应,即使它们满足了用户的需求。为了突出知识图谱相关任务中的机遇与挑战,我们在静态知识图谱的知识图谱补全上实验了三个著名的 LLM,即 Mixtral-8x7b-Instruct-v0.1、GPT-3.5-Turbo-0125 和 GPT-4o,在零样本和单样本上下文中,使用基于 TELeR 分类法构建的提示,应用于面向任务的对话系统用例。当使用严格和灵活的度量方式进行评估时,我们的结果表明,如果提示包含足够的信息和相关示例,LLM 可能适合此类任务。
引用
@article{arxiv.2405.17249,
title = {Assessing LLMs Suitability for Knowledge Graph Completion},
author = {Vasile Ionut Remus Iga and Gheorghe Cosmin Silaghi},
journal= {arXiv preprint arXiv:2405.17249},
year = {2024}
}
备注
Accepted at 18th International Conference on Neural-Symbolic Learning and Reasoning, NESY 2024. Evaluating Mixtral-8x7b-Instruct-v0.1, GPT-3.5-Turbo-0125 and GPT-4o for Knowledge Graph Completion task with prompts formatted according to the TELeR taxonomy