中文

评估与增强大型语言模型在知识图谱上的会话推理

计算与语言 2024-11-18 v3 人工智能

摘要

大型语言模型 (LLM) 的发展得益于预训练技术的进步。这些模型通过人工设计的提示展示了强大的推理能力。在这项工作中,我们评估了当前最先进的 LLM (GPT-4) 在知识图谱 (KG) 上的会话推理能力。然而,由于缺乏 KG 环境感知以及难以在中间推理阶段开发有效的优化机制,LLM 的性能受到限制。我们进一步引入了 LLM-ARK,这是一个基于 LLM 的 KG 推理智能体,旨在对 KG 路径提供精确且适应性强的预测。LLM-ARK 利用全文本环境 (FTE) 提示在每个推理步骤中吸收状态信息。我们将 KG 上的多跳推理挑战重新构建为序列决策任务。利用近端策略优化 (PPO) 在线策略梯度强化学习算法,我们的模型被优化以从丰富的奖励信号中学习。此外,我们在 OpenDialKG 数据集上对我们的模型和 GPT-4 进行了评估。实验结果表明,LLaMA-2-7B-ARK 在 target@1 评估指标上以 36.39% 的性能率优于当前最先进模型 5.28 个百分点。同时,GPT-4 得分为 14.91%,进一步证明了我们方法的有效性。我们的代码可在 GitHub (https://github.com/Aipura/LLM-ARK) 上获取以供进一步访问。

关键词

引用

@article{arxiv.2312.11282,
  title  = {Evaluating and Enhancing Large Language Models for Conversational Reasoning on Knowledge Graphs},
  author = {Yuxuan Huang},
  journal= {arXiv preprint arXiv:2312.11282},
  year   = {2024}
}