中文

暗夜之后:大语言模型中事实性幻觉的实证研究

计算与语言 2024-01-09 v1

摘要

在大语言模型(LLM)时代,幻觉(即生成事实上不正确内容的倾向)对LLM在现实应用中的可信赖和可靠部署构成了巨大挑战。为了解决LLM幻觉问题,需要深入研究三个关键问题:如何检测幻觉(检测)、LLM为何产生幻觉(来源)以及如何缓解幻觉(缓解)。为应对这些挑战,本文对LLM幻觉进行了系统的实证研究,重点关注幻觉检测、来源和缓解这三个方面。具体而言,我们构建了一个新的幻觉基准HaluEval 2.0,并设计了一种简单而有效的LLM幻觉检测方法。此外,我们深入研究了LLM的不同训练或使用阶段,并广泛分析了导致LLM幻觉的潜在因素。最后,我们实施并检验了一系列广泛使用的技术来缓解LLM中的幻觉。我们的工作得出了若干重要发现,有助于理解幻觉起源并缓解LLM中的幻觉。我们的代码和数据可在https://github.com/RUCAIBox/HaluEval-2.0获取。

关键词

引用

@article{arxiv.2401.03205,
  title  = {The Dawn After the Dark: An Empirical Study on Factuality Hallucination in Large Language Models},
  author = {Junyi Li and Jie Chen and Ruiyang Ren and Xiaoxue Cheng and Wayne Xin Zhao and Jian-Yun Nie and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2401.03205},
  year   = {2024}
}

备注

24 pages, 8 figures, 13 tables