基于隐藏状态传输几何的步骤级幻觉检测
计算与语言
2026-05-14 v1 人工智能
摘要
大型语言模型在多步推理过程中会产生幻觉,但大多数现有检测器 operate at the trace level:它们为完整输出分配一个置信度得分,无法定位第一个错误,且通常需要多个抽样完成。在此框架下,我们将幻觉视为隐藏状态轨迹在单次前向传递期间的性质。正确的推理通过一系列稳定的局部一致转换;第一个错误表现为传输成本相对于该轨迹的局部偏离。我们用一个在标签条件下训练的教师模型构建特定轨迹的对比性 PCA 透镜,并以七个几何转换特征对每个步骤打分;随后我们部署一个从教师模型蒸馏的 BiLSTM 学生模型,可在原始隐藏状态上运行,无需推理时的标签。我们证明了对比 PCA 是在第一个错误与正确状态之间进行传输分离目标的最优投影,并且只要第一个错误在此前正确转换上创建正传输边际,就可以实现单次传递的第一个错误定位。在 ProcessBench、PRM800K、HaluEval 和 TruthfulQA 上,两个模型在各自领域内均优于基于熵的、探针的和注意力的基线;教师模型在跨语言模型和跨数据集的迁移稳定,而学生模型在分布迁移下会崩溃——这一差异是我们的蒸馏理论所预测的。这些结果将步骤级幻觉检测重新诠释为轨迹动力学的问题,并识别了部署的核心障碍:在分布迁移下保持对比传输边际。
引用
@article{arxiv.2605.13772,
title = {Where Does Reasoning Break? Step-Level Hallucination Detection via Hidden-State Transport Geometry},
author = {Tyler Alvarez and Ali Baheri},
journal= {arXiv preprint arXiv:2605.13772},
year = {2026}
}