中文

HaluEval:面向大语言模型的大规模幻觉评测基准

计算与语言 2023-10-24 v3

摘要

大语言模型(LLMs),如 ChatGPT,容易生成幻觉,即与源内容冲突或无法被事实知识验证的内容。为理解 LLMs 倾向于生成何种类型的幻觉以及幻觉的程度,我们提出了大语言模型幻觉评测基准(HaluEval),这是一个由生成样本与人工标注幻觉样本组成的大规模集合,用于评估 LLMs 识别幻觉的性能。为生成这些样本,我们提出了一种基于 ChatGPT 的两步框架,即先采样后过滤。此外,我们还雇佣了人工标注员对 ChatGPT 回复中的幻觉进行标注。实证结果表明,ChatGPT 在特定主题下可能通过编造无法验证的信息(即约 19.5%19.5\% 的回复)来生成幻觉内容。而且,现有 LLMs 在识别文本中的幻觉方面面临巨大挑战。然而,我们的实验也证明,提供外部知识或增加推理步骤可帮助 LLMs 识别幻觉。我们的基准可通过 https://github.com/RUCAIBox/HaluEval 访问。

关键词

引用

@article{arxiv.2305.11747,
  title  = {HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models},
  author = {Junyi Li and Xiaoxue Cheng and Wayne Xin Zhao and Jian-Yun Nie and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2305.11747},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 Main Conference (Long Paper)