中文

DefAn:用于大语言模型幻觉评估的确定性答案数据集

计算与语言 2024-06-14 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

大语言模型(LLMs)展现了卓越的能力,彻底改变了人工智能在日常生活中的应用。然而,它们容易产生幻觉,即生成与既定事实相矛盾的陈述、偏离提示,以及在多次呈现相同提示时产生不一致的响应。由于缺乏全面且易于评估的基准数据集,解决这些问题具有挑战性。现有的大多数数据集规模较小,且依赖于多项选择题,不足以评估LLMs的生成能力。为了衡量LLMs中的幻觉,本文引入了一个全面的基准数据集,包含跨越八个领域的超过75,000个提示。这些提示旨在引出确定性、简洁且信息丰富的答案。该数据集分为两部分:一部分公开用于测试和评估LLM性能,另一部分隐藏用于对各种LLM进行基准测试。在我们的实验中,我们测试了六个LLM——GPT-3.5、LLama 2、LLama 3、Gemini、Mixtral和Zephyr——结果显示,在公开数据集上,整体事实性幻觉范围为59%到82%,在隐藏基准中为57%到76%。提示错位幻觉在公开数据集中范围为6%到95%,在隐藏基准中为17%到94%。平均一致性在公开数据集中范围为21%到61%,在隐藏基准中为22%到63%。按领域分析表明,当询问具体的数字信息时,LLM性能显著下降,而在处理人物、地点和日期查询时表现中等。我们的数据集证明了其有效性,并可作为LLM性能评估的全面基准。我们的数据集和LLM响应可在\href{https://github.com/ashikiut/DefAn}{https://github.com/ashikiut/DefAn}获取。

关键词

引用

@article{arxiv.2406.09155,
  title  = {DefAn: Definitive Answer Dataset for LLMs Hallucination Evaluation},
  author = {A B M Ashikur Rahman and Saeed Anwar and Muhammad Usman and Ajmal Mian},
  journal= {arXiv preprint arXiv:2406.09155},
  year   = {2024}
}