中文

HaluNet:从 LLM 问答的内部信号中学习幻觉风险

计算与语言 2026-05-29 v2

摘要

大型语言模型(LLM)在问答(QA)任务中取得了强大的性能,但可能产生缺乏可用证据支持的流畅答案。现有的幻觉检测器通常依赖于外部验证、重复采样或测试时的判别调用,这对于实时 QA 来说可能成本高昂。我们提出了 HaluNet,一种轻量级的幻觉风险估计器,它利用单次模型生成的内部信号。HaluNet 联合建模了词元似然、预测熵和隐藏状态信息,允许概率性、分布性和语义性证据共同构成答案级别的风险评分。它使用 LLM-as-a-Judge 标签作为可扩展的弱监督进行训练,并通过独立的人工评估和多评判者评估进行评价。在 SQuAD、TriviaQA 和 Natural Questions 上的实验表明,HaluNet 在域内和域外设置中均改善了答案级别的风险排序。在一项包含 300 个样本的人工评估中,HaluNet 达到了 0.874 的 AUROC 和 0.869 的 AUPRC;其风险最高的前 20% 答案包含了 96.5% 的错误,相对于基础错误率实现了 2.06 倍的提升。

关键词

引用

@article{arxiv.2512.24562,
  title  = {HaluNet: Learning Hallucination Risk from Internal Signals in LLM Question Answering},
  author = {Chaodong Tong and Qi Zhang and Zhuojun Jiang and Lei Jiang and Yanbing Liu},
  journal= {arXiv preprint arXiv:2512.24562},
  year   = {2026}
}

备注

16 pages, 12 tables, and 11 figures. This version includes a major revision of the manuscript and updates the author list with the consent of all involved authors