无需纠正的检测:激活基检测幻觉的鲁棒性不对称
计算与语言
2026-05-12 v2 机器学习
摘要
基于激活的线性探针广泛被提议作为检测和纠正自回归语言模型幻觉的方法。我们对七个覆盖117M至7B参数、三个架构族(GPT-2、Pythia、Qwen-2.5)的模型进行实证研究,记录了一种鲁棒性不对称:线性探针在大型模型中可实现超出随机水平的检测准确率,但激活引导沿探针导出的方向进行纠正,在所有测试的7个模型中均无法纠正幻觉。我们进一步发现,输出置信度基准在所有4.1亿参数以上的模型中,在原始检测 AUC 上超越激活探针,差距达到0.157个百分点(针对Pythia-6.9B)。因此,探针的区分价值不在于检测准确率,而在于时间定位:探针信号可在位置零(生成任何输出标记之前)被访问,使其在生成前进行标记成为可能,而基于输出的方法在结构上无法提供。该时间信号在两个模型中具有统计显著性(Pythia-1.4B, p = 0.012;Qwen2.5-7B, p = 0.038),而在400M参数以下的模型和仅基于基础模型的Pythia-6.9B中则不存在。我们将这些发现定位为占主导地位的探针作为检测与控制研究方向的明确负结果,以及探针方法占据补充部署 niche 的初始证据,即生成前标记,而非与基于输出的探针在原始准确率上竞争。
引用
@article{arxiv.2604.13068,
title = {Detection Without Correction: A Robust Asymmetry in Activation-Based Hallucination Probing},
author = {Dip Roy and Rajiv Misra and Sanjay Kumar Singh and Anisha Roy},
journal= {arXiv preprint arXiv:2604.13068},
year = {2026}
}