基于 Zigzag 持久性的 HalluZig 幻觉检测
计算与语言
2026-01-21 v2
摘要
大型语言模型(LLM)的事实可靠性仍是其在高风险领域广泛采用的关键障碍,由于其倾向于生成幻觉内容。当前的检测方法通常依赖模型输出中的表面信号,忽略模型内部推理过程中发生的错误。在本文中,我们提出一种新的幻觉检测范式,通过分析模型层级注意力演化的动态拓扑结构。我们将注意力矩阵序列建模为 zigzag 图滤波器,使用 zigzag 持久性这一拓扑数据分析工具提取拓扑特征。我们的核心假设是,事实性生成和幻觉生成的产生不同的拓扑特征。我们在多个基准测试上验证了该框架HalluZig,表明其优于强基准。此外,我们的分析揭示了这些拓扑特征在不同模型之间具有可 generalization性,并且仅使用部分网络深度的结构特征即可实现幻觉检测。
关键词
引用
@article{arxiv.2601.01552,
title = {HalluZig: Hallucination Detection using Zigzag Persistence},
author = {Shreyas N. Samaga and Gilberto Gonzalez Arroyo and Tamal K. Dey},
journal= {arXiv preprint arXiv:2601.01552},
year = {2026}
}