中文

面向幻觉检测的预训练不确定性量化头:用于预测与提问

计算与语言 2025-05-14 v1 人工智能

摘要

大型语言模型 (LLM) 倾向于产生幻觉现象,即偶发的虚假或虚构信息。这构成了主要挑战,因为幻觉往往看起来极具说服力,而用户通常缺乏工具来检测它们。不确定性量化 (UQ) 提供了一种评估模型输出可靠性的框架,有助于识别潜在的幻觉。在本 work 中,我们引入了预训练 UQ 头:一种为 LLM 提供的监督式辅助模块,显著增强了其捕捉不确定性的能力,与非监督式 UQ 方法相比效果更佳。其强大的性能源于其设计中的强大 Transformer 架构以及来自 LLM 注意力图的信息性特征。实验评估表明,这些头非常稳健,在两个 in-domain 和 out-domain 提示下均在主张水平的幻觉检测中实现了最先进的性能。此外,这些模块对它们未明确训练的语言具有强大的泛化能力。我们为流行的 LLM 系列(包括 Mistral、Llama 和 Gemma 2)预训练了一套 UQ 头。我们公开发布了代码和预训练的头。

关键词

引用

@article{arxiv.2505.08200,
  title  = {A Head to Predict and a Head to Question: Pre-trained Uncertainty Quantification Heads for Hallucination Detection in LLM Outputs},
  author = {Artem Shelmanov and Ekaterina Fadeeva and Akim Tsvigun and Ivan Tsvigun and Zhuohan Xie and Igor Kiselev and Nico Daheim and Caiqi Zhang and Artem Vazhentsev and Mrinmaya Sachan and Preslav Nakov and Timothy Baldwin},
  journal= {arXiv preprint arXiv:2505.08200},
  year   = {2025}
}