生成模型中基于熵分布的指纹识别幻觉
人工智能
2026-05-28 v1
摘要
大型语言模型(LLM)常生成事实错误的输出,称为幻觉,这削弱了信任度并限制了在高风险场景中的部署。现有的幻觉检测方法通常需要多次前向传播,或访问模型内部。在本工作中,我们提供理论背景和实证证据,表明除了困惑度或长度归一化熵所捕获的均值之外,标记级熵的分布(其分布形状和尾部行为)本身携带独立的信号,可作为幻觉的指纹。我们将幻觉检测形式化为统计假设检验,提出校准熵得分(Calibrated Entropy Score, CES),这是一种轻量级算法,只需一次前向传播即可获得模型输出的标记概率分布。CES 将均值信号与生成熵的最大值信号结合,通过校准参考累积分布函数(CDF)生成可跨模型和任务直接比较的得分。我们通过一种新颖的随机长度 Dvoretzky--Kiefer--Wolfowitz 不等式建立了有限样本校准保证,并证明了 CES 在生成长度指数级收敛到 1 的概率下检测幻觉。在八个 QA 基准测试和十个生成模型(涵盖开源和 API 访问模型)上,CES 在所有单次前向传播的黑盒方法中实现了最高的检测性能,同时提供了现有启发式方法所 lacking 的正式错误保证。令人惊讶的是,CES 在统计上几乎等同于需要更大计算成本的多采样方法,缩小了轻量级和高成本检测方法之间的差距,使其适用于实时大规模部署。
引用
@article{arxiv.2605.28264,
title = {Entropy Distribution as a Fingerprint for Hallucinations in Generative Models},
author = {Mattia J. Villani and Pranav Deshpande and Akshay Seshadri and Romina Yalovetzky and Niraj Kumar},
journal= {arXiv preprint arXiv:2605.28264},
year = {2026}
}