中文

大语言模型能否检测自身的幻觉现象?

计算与语言 2025-11-17 v1

摘要

大语言模型(LLMs)能够生成流畅的响应,但有时会产生幻觉现象。本文探讨 LLMs 是否能够检测自身的幻觉。我们将幻觉检测形式化为句子分类任务。我们提出了估计 LLMs 幻觉检测能力的框架,并提出一种使用链式思维(Chain-of-Thought, CoT)从参数中提取知识的分类方法。实验结果表明,配合 CoT 的 GPT-3.53.5 Turbo 检测自身幻觉的比例为 58.2%58.2\%。我们得出结论,具备 CoT 能力的 LLMs 若其参数中蕴含足够知识,就能够检测幻觉现象。

关键词

引用

@article{arxiv.2511.11087,
  title  = {Can LLMs Detect Their Own Hallucinations?},
  author = {Sora Kadotani and Kosuke Nishida and Kyosuke Nishida},
  journal= {arXiv preprint arXiv:2511.11087},
  year   = {2025}
}

备注

8 pages