利用 LLM 内部层进行幻觉检测
计算与语言
2025-09-19 v1 人工智能
摘要
大语言模型(LLM)在多种自然语言处理任务中取得了成功 [Zha+25]。然而,它们存在显著局限性。LLM 倾向于生成幻觉——看似合理但缺乏事实依据的输出 [Hua+24],这在现实世界中会产生严重后果 [Kay23; Rum+24]。近期研究表明,利用 LLM 内部表示的基于探测的分类器可以检测幻觉 [AM23; Bei+24; Bur+24; DYT24; Ji+24; SMZ24; Su+24]。该方法由于不涉及模型训练,可以在不显著增加计算成本的情况下增强可靠性。基于此方法,本论文提出了利用 LLM 内部表示进行幻觉检测的新方法,并在三个基准数据集上进行了评估:TruthfulQA、HaluEval 和 ReFact。具体而言,开发了一种新的架构,能够动态加权和组合 LLM 内部层,以提升幻觉检测性能。通过大量实验,获得了两个关键发现:第一,所提出的方法在性能上优于传统探测方法,尽管在基准数据集和 LLM 之间的泛化仍具有挑战性。第二,这些泛化局限性可以通过跨基准训练和参数冻结来缓解。尽管并非始终有效,但两种技术都在单个基准上取得了更好的性能,并减少了迁移到其他基准时的性能下降。这些发现为通过内部表示分析提升 LLM 可靠性开辟了新途径。
引用
@article{arxiv.2509.14254,
title = {Hallucination Detection with the Internal Layers of LLMs},
author = {Martin Preiß},
journal= {arXiv preprint arXiv:2509.14254},
year = {2025}
}
备注
Master's thesis