中文

语言模型幻觉如何滚雪球式放大

计算与语言 2023-05-24 v1

摘要

在实用应用中使用语言模型的一大风险是它们倾向于幻觉出不正确的陈述。幻觉常被归因于语言模型的知识缺口,但我们假设在某些情况下,当为先前生成的幻觉进行辩解时,语言模型会输出其单独能够识别出不正确的虚假断言。我们构建了三个问答数据集,其中 ChatGPT 和 GPT-4 经常给出错误答案,并给出至少含一条错误断言的解释。关键在于,我们发现 ChatGPT 和 GPT-4 分别能识别出自身 67% 和 87% 的错误。我们将此现象称为幻觉滚雪球(hallucination snowballing):语言模型过度坚持早期错误,导致更多其原本不会犯的错误。

关键词

引用

@article{arxiv.2305.13534,
  title  = {How Language Model Hallucinations Can Snowball},
  author = {Muru Zhang and Ofir Press and William Merrill and Alisa Liu and Noah A. Smith},
  journal= {arXiv preprint arXiv:2305.13534},
  year   = {2023}
}