中文

ChainPoll:一种高效的 LLM 幻觉检测方法

计算与语言 2023-10-31 v1 人工智能 机器学习

摘要

大语言模型(LLM)在生成连贯且上下文相关的响应方面取得了显著进展。然而,幻觉——不正确或毫无根据的断言——仍然普遍存在,促使人们创建自动指标以检测 LLM 输出中的此类问题。我们的贡献包括:引入 ChainPoll,一种优于同类方法的创新幻觉检测方法;以及发布 RealHall,一个精炼的基准数据集集合,用于评估近期研究的幻觉检测指标。在创建 RealHall 时,我们评估了先前幻觉检测研究的任务与数据集,观察到许多并不适用于当前强大的 LLM。为克服这一点,我们选择了四个对现代 LLM 具有挑战性且与真实场景相关的数据集。使用 RealHall,我们对 ChainPoll 与近期研究的众多幻觉指标进行了全面比较。我们的发现表明,ChainPoll 在所有 RealHall 基准中均表现更优,总体 AUROC 达 0.781。这比次优理论方法高出 11%,超出行业标准逾 23%。此外,ChainPoll 具有成本效益,且比其他指标提供更强的透明度。我们引入两个评估 LLM 幻觉的新指标:Adherence 与 Correctness。Adherence 与检索增强生成工作流相关,评估 LLM 在给定文档与上下文中的分析能力;相反,Correctness 识别逻辑与推理错误。

关键词

引用

@article{arxiv.2310.18344,
  title  = {Chainpoll: A high efficacy method for LLM hallucination detection},
  author = {Robert Friel and Atindriyo Sanyal},
  journal= {arXiv preprint arXiv:2310.18344},
  year   = {2023}
}