中文

防患于未然:通过验证低置信度生成来检测与缓解大语言模型的幻觉

计算与语言 2023-08-15 v2

摘要

近年来开发的大语言模型(LLM)在生成流畅且连贯的文本方面取得了显著成功。然而,这些模型往往容易“幻觉”,严重损害了其可靠性。本文针对这一关键问题,提出了一种在生成过程中主动检测并缓解幻觉的方法。具体而言,我们首先利用模型的logit输出值识别潜在幻觉候选,通过验证程序检查其正确性,缓解已检测到的幻觉,然后继续生成过程。通过在“文章生成任务”上使用GPT-3.5(text-davinci-003)的大量实验,我们首先展示了检测与缓解技术各自的效能。具体而言,检测技术达到了约88%的召回率,缓解技术成功缓解了57.6%被正确检测到的幻觉。重要的是,即使在错误检测到的幻觉(即假阳性)情况下,我们的缓解技术也不会引入新的幻觉。随后,我们表明所提出的主动检测与缓解方法将GPT-3.5模型的幻觉率从平均47.5%成功降低至14.5%。我们通过额外研究进一步证明了方法的有效性与广泛适用性,包括在不同类型问题(多跳与错误前提问题)上的表现,以及使用来自不同模型族的另一个LLM(Vicuna)。总之,我们的工作有助于提升大语言模型的可靠性与可信度,这是实现其在现实应用中广泛采用的关键一步。

关键词

引用

@article{arxiv.2307.03987,
  title  = {A Stitch in Time Saves Nine: Detecting and Mitigating Hallucinations of LLMs by Validating Low-Confidence Generation},
  author = {Neeraj Varshney and Wenlin Yao and Hongming Zhang and Jianshu Chen and Dong Yu},
  journal= {arXiv preprint arXiv:2307.03987},
  year   = {2023}
}

备注

update to include additional experiments