中文

HalluGuard:揭秘 LLM 中数据驱动与推理驱动的幻觉

机器学习 2026-03-03 v2 人工智能

摘要

在高风险领域(如医疗保健、法律和科学发现)中,大型语言模型(LLM)的可靠性常常因幻觉而受损。这些失败通常源于两个方面:数据驱动的幻觉和推理驱动的幻觉。然而,现有的检测方法通常只解决其中一个方面,并依赖于特定于任务的启发式方法,限制了它们在复杂场景中的泛化能力。为了克服这些局限性,我们引入了幻觉风险界,这是一个统一的理论框架,将幻觉风险形式化地分解为数据驱动和推理驱动的部分,分别与训练时的不匹配和推理时的不稳定性相关联。这为分析幻觉如何产生和演变提供了有原则的基础。在此基础之上,我们引入了 HalluGuard,一种基于 NTK 的分数,利用 NTK 的诱导几何和捕获的表示来联合识别数据驱动和推理驱动的幻觉。我们在 10 个多样化的基准测试、11 个竞争基线和 9 个流行的 LLM 主干上评估了 HalluGuard,在检测各种形式的 LLM 幻觉方面始终取得 SOTA 性能。我们在 https://github.com/Susan571/HalluGuard-ICLR2026 开源了我们提出的 \model{} 模型。

关键词

引用

@article{arxiv.2601.18753,
  title  = {HalluGuard: Demystifying Data-Driven and Reasoning-Driven Hallucinations in LLMs},
  author = {Xinyue Zeng and Junhong Lin and Yujun Yan and Feng Guo and Liang Shi and Jun Wu and Dawei Zhou},
  journal= {arXiv preprint arXiv:2601.18753},
  year   = {2026}
}

备注

Accepted by The Fourteenth International Conference on Learning Representations (ICLR'26)