SelfCheckGPT:面向生成式大语言模型的零资源黑盒幻觉检测方法
计算与语言
2023-10-12 v3
摘要
生成式大语言模型(LLM)如GPT-3能够针对各类用户提示生成高度流畅的回复。然而,已知LLM会幻觉事实并作出非事实性陈述,这可能削弱对其输出的信任。现有的事实核查方法要么需要访问输出概率分布(对于ChatGPT等系统可能不可用),要么需要经由独立且通常复杂的模块接口的外部数据库。在本工作中,我们提出“SelfCheckGPT”,一种简单的基于采样的方法,可用于以零资源方式(即无需外部数据库)对黑盒模型的回复进行事实核查。SelfCheckGPT利用了简单思想:若LLM掌握某给定概念的知识,采样回复很可能相似且包含一致事实;而对于幻觉事实,随机采样回复很可能发散且相互矛盾。我们通过使用GPT-3基于WikiBio数据集生成关于个人的段落,并人工标注生成段落的事实性来研究该方法。我们证明SelfCheckGPT能够:i)检测非事实与事实性句子;以及ii)按事实性对段落排序。我们将我们的方法与若干基线比较,表明在句子级幻觉检测上我们的方法AUC-PR分数显著高于灰盒方法,在段落级事实性评估上相关性分数更高。
引用
@article{arxiv.2303.08896,
title = {SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models},
author = {Potsawee Manakul and Adian Liusie and Mark J. F. Gales},
journal= {arXiv preprint arXiv:2303.08896},
year = {2023}
}
备注
EMNLP 2023 (main conference)