单一真实方向:观察者模型的线性残差探针揭示并引导上下文幻觉
机器学习
2025-08-01 v1
摘要
上下文幻觉——即不受给定上下文支持的陈述——仍然是AI领域的一项重大挑战。我们展示了一项实用的可解释性洞察:一个与生成器无关的观察者模型可通过单次前向传播及其残差流上的线性探针来检测幻觉。该探针分离出一个单一的、可迁移的线性方向,用以区分幻觉文本与忠实文本,性能超过基线5至27个百分点,并在Gemma-2模型(2B至27B)中表现出稳健的中层性能。梯度乘以激活将该信号定位至稀疏的后期MLP活动。关键在于,操纵该方向能够因果性地引导生成器的幻觉率,证明了其可操作性。我们的结果提供了新证据,表明存在与特定MLP子电路相关的内部低维幻觉跟踪机制,可用于检测与缓解。我们发布了包含2000个样本的ContraTales基准测试集,用于对此类解决方案进行真实评估。
引用
@article{arxiv.2507.23221,
title = {A Single Direction of Truth: An Observer Model's Linear Residual Probe Exposes and Steers Contextual Hallucinations},
author = {Charles O'Neill and Slava Chalnev and Chi Chi Zhao and Max Kirkby and Mudith Jayasekara},
journal= {arXiv preprint arXiv:2507.23221},
year = {2025}
}