基于多重检验的大语言模型 hallucination 原则检测方法
计算与语言
2026-04-29 v3 人工智能
机器学习
摘要
虽然大语言模型(LLMs)已成为解决多种任务的强大基础模型,但它们也被证明容易产生 hallucination,即生成听起来自信但实际上不正确甚至毫无意义的响应。现有的 hallucination 检测器提出了多种经验评分规则,但其性能在不同模型和数据集之间存在差异,实际应用中难以确定应依赖哪些方法或将其视为可靠检测器。在本工作中,我们将检测 hallucination 的问题形式化为假设检验问题,并与机器学习模型中的 out-of-distribution 检测问题进行类比。我们随后提出一种基于多重检验的方法,通过共形 p 值系统地聚合多个评估得分,以实现受控误报率的校准化检测。广泛的实验在不同模型和数据集上验证了我们方法对 state-of-the-art 方法的鲁棒性。
引用
@article{arxiv.2508.18473,
title = {Principled Detection of Hallucinations in Large Language Models via Multiple Testing},
author = {Jiawei Li and Akshayaa Magesh and Venugopal V. Veeravalli},
journal= {arXiv preprint arXiv:2508.18473},
year = {2026}
}
备注
14 pages, 2 figures