中文

使用大规模知识图谱评估大型语言模型的事实性

计算与语言 2024-04-02 v1 人工智能 机器学习

摘要

大型语言模型的出现极大地改变了人工智能的格局,提升了机器学习和人工智能的能力。事实性问题是 LLMs 的一个关键关注点,因为它们可能会生成事实上不正确的回答。在本文中,我们提出 GraphEval,使用一个规模庞大的测试数据集来评估 LLM 的性能。具体而言,该测试数据集是从包含超过 1000 万条事实的大型知识图谱中检索得到的,无需昂贵的人工投入。与基于生成响应评估 LLMs 的传统方法不同,GraphEval 通过创建一个评判模型来估计 LLM 给出答案的正确性,从而简化了评估过程。我们的实验表明,评判模型的事实性评估与 LLM 生成输出的正确性高度一致,同时大幅降低了评估成本。此外,我们的发现为 LLM 在不同指标下的性能提供了有价值的见解,并突显了未来在确保 LLM 输出事实完整性方面的改进潜力。代码已公开于 https://github.com/xz-liu/GraphEval。

关键词

引用

@article{arxiv.2404.00942,
  title  = {Evaluating the Factuality of Large Language Models using Large-Scale Knowledge Graphs},
  author = {Xiaoze Liu and Feijie Wu and Tianyang Xu and Zhuo Chen and Yichi Zhang and Xiaoqian Wang and Jing Gao},
  journal= {arXiv preprint arXiv:2404.00942},
  year   = {2024}
}