中文

从内部探测大语言模型幻觉:基于内部知识的扰动驱动方法

人工智能 2025-09-17 v4 计算与语言

摘要

大语言模型(LLM)幻觉,即生成不忠实文本的现象,对LLM的实际应用构成了严峻挑战。当前的检测方法通常依赖外部知识、LLM微调或使用大量带幻觉标签的数据集进行监督训练。此外,这些方法不区分不同类型的幻觉,而区分类型对于提升检测性能至关重要。为解决这些局限,我们引入了幻觉探测(hallucination probing)这一新任务,将LLM生成的文本分为三类:对齐、未对齐和捏造。基于我们的新发现——即扰动提示中的关键实体对LLM生成这三类文本的影响不同——我们提出了SHINE,一种新颖的幻觉探测方法,它不需要外部知识、监督训练或LLM微调。SHINE在三个现代LLM上的幻觉探测中表现有效,并在幻觉检测任务上达到了最先进性能,在四个数据集和四个LLM上优于七种对比方法,凸显了探测对于准确检测的重要性。

关键词

引用

@article{arxiv.2411.09689,
  title  = {Probing LLM Hallucination from Within: Perturbation-Driven Approach via Internal Knowledge},
  author = {Seongmin Lee and Hsiang Hsu and Chun-Fu Chen and Duen Horng Chau},
  journal= {arXiv preprint arXiv:2411.09689},
  year   = {2025}
}

备注

22 pages, 15 figures