大语言模型能否检测自身的幻觉现象?
计算与语言
2025-11-17 v1
摘要
大语言模型(LLMs)能够生成流畅的响应,但有时会产生幻觉现象。本文探讨 LLMs 是否能够检测自身的幻觉。我们将幻觉检测形式化为句子分类任务。我们提出了估计 LLMs 幻觉检测能力的框架,并提出一种使用链式思维(Chain-of-Thought, CoT)从参数中提取知识的分类方法。实验结果表明,配合 CoT 的 GPT- Turbo 检测自身幻觉的比例为 。我们得出结论,具备 CoT 能力的 LLMs 若其参数中蕴含足够知识,就能够检测幻觉现象。
引用
@article{arxiv.2511.11087,
title = {Can LLMs Detect Their Own Hallucinations?},
author = {Sora Kadotani and Kosuke Nishida and Kyosuke Nishida},
journal= {arXiv preprint arXiv:2511.11087},
year = {2025}
}
备注
8 pages