HIVE:基于隐藏证据的扩散型大语言模型幻觉检测
计算与语言
2026-05-18 v2
摘要
扩散型大语言模型通过多步骤去噪生成文本,其中幻觉信号可能在轨迹中而非仅在最终输出中出现。现有检测器主要依赖输出不确定性或粗糙的轨迹统计信息,往往无法捕捉D-LLMs更丰富的隐藏动态。我们提出了HIVE框架,从去噪轨迹中提取压缩后的隐藏证据,选择信息丰富的步骤-层证据,并通过前缀嵌入将选定证据条件化于验证语言模型。HIVE产生持续的幻觉得分(来自验证器决策logits)以及结构化验证输出,包括幻觉类型、证据对和简短理由。在两个D-LLMs和三个QA基准测试上,HIVE consistently优于八个强大的基线,实现最高0.9236的AUROC和0.9537的AUPRC。消融研究进一步确认隐藏证据条件化、学习型证据选择、双流证据表示和步骤-层嵌入的重要性。这些结果表明,从去噪轨迹中选择的隐藏证据比仅靠输出不确定性或粗糙的轨迹统计提供更强、更可用的幻觉信号。
引用
@article{arxiv.2604.26139,
title = {HIVE: Hidden-Evidence Verification for Hallucination Detection in Diffusion Large Language Models},
author = {Guoshenghui Zhao and Tan Yu and Weijie Zhao},
journal= {arXiv preprint arXiv:2604.26139},
year = {2026}
}
备注
5 figures, appendix included