基于知识图谱的虚假前提问题评估大语言模型事实性幻觉
计算与语言
2024-12-24 v2 人工智能
摘要
近期研究表明,大语言模型(LLM)容易被误导性问题(虚假前提问题,FPQ)所影响,导致事实性知识错误,即所谓事实性幻觉。现有评估此脆弱性的基准主要依赖人工构建,规模有限且缺乏可扩展性。本文引入一种自动化、可扩展的管道,用于创建基于知识图谱(KG)的FPQ。第一步是修改从KG中提取的真实三元组以创建虚假前提。随后,利用GPT等最新技术生成语义丰富的FPQ。基于所提出的方法,我们构建了一个全面的基准,称为知识图谱基虚假前提问题(KG-FPQ),其中包含约17.8万个FPQ,覆盖三个知识领域,分为六个可辨识程度,并提供两种任务格式。使用KG-FPQ,我们对几类代表性LLM进行了广泛评估,并提供了宝贵的见解。KG-FPQ数据集和代码均可在 https://github.com/yanxuzhu/KG-FPQ 查阅。
引用
@article{arxiv.2407.05868,
title = {KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions},
author = {Yanxu Zhu and Jinlin Xiao and Yuhang Wang and Jitao Sang},
journal= {arXiv preprint arXiv:2407.05868},
year = {2024}
}
备注
COLING2025 main