HaluEval-Wild:评估开放场景下语言模型的幻觉
计算与语言
2024-09-17 v3
摘要
幻觉对大型语言模型(LLM)在关键领域的可靠性构成了重大挑战。近期旨在评估传统自然语言处理任务(如知识密集型问答和摘要)中 LLM 幻觉的基准测试,不足以捕捉动态真实世界场景中用户与 LLM 交互的复杂性。为填补这一空白,我们推出了 HaluEval-Wild,这是首个专门用于评估开放场景下 LLM 幻觉的基准测试。我们从现有的真实世界用户 -LLM 交互数据集 ShareGPT 中精心收集了具有挑战性的(经 Alpaca 对抗性筛选)用户查询,以评估各种 LLM 的幻觉率。通过分析收集到的查询,我们将它们分为五种不同的类型,从而能够对 LLM 表现出的幻觉类型进行细粒度分析,并利用强大的 GPT-4 模型和检索增强生成(RAG)合成参考答案。我们的基准测试提供了一种新颖的方法,有助于加深我们对反映真实世界交互场景中 LLM 可靠性的理解并加以改进。我们的基准测试可在 https://github.com/HaluEval-Wild/HaluEval-Wild 获取。
引用
@article{arxiv.2403.04307,
title = {HaluEval-Wild: Evaluating Hallucinations of Language Models in the Wild},
author = {Zhiying Zhu and Yiming Yang and Zhiqing Sun},
journal= {arXiv preprint arXiv:2403.04307},
year = {2024}
}