中文

面向LLM幻觉检测的提示引导内部状态

计算与语言 2025-05-23 v3

摘要

大型语言模型(LLM)在不同领域的各种任务中展现出惊人的能力,但有时会生成在逻辑上连贯但事实错误或误导性的响应,这称为LLM幻觉。数据驱动的监督方法通过利用LLM内部状态训练幻觉检测器,但在特定领域训练的检测器往往难以很好地泛化到其他领域。本文旨在仅使用领域内数据提高监督检测器的跨域性能。我们提出了一种新框架,即提示引导LLM内部状态用于幻觉检测,称为PRISM。通过利用适当的提示引导LLM内部状态中与文本真实性相关的结构,使该结构在来自不同领域的文本间更加显著且一致。我们将我们的框架与现有的幻觉检测方法集成,并在不同领域的数据集上进行实验。实验结果表明,我们的框架显著提高了现有幻觉检测方法的跨域泛化能力。

关键词

引用

@article{arxiv.2411.04847,
  title  = {Prompt-Guided Internal States for Hallucination Detection of Large Language Models},
  author = {Fujie Zhang and Peiqi Yu and Biao Yi and Baolei Zhang and Tong Li and Zheli Liu},
  journal= {arXiv preprint arXiv:2411.04847},
  year   = {2025}
}