基于开放权重代理分析器的幻觉检测
摘要
我们提出一种用于检测大型语言模型幻觉的代理分析器框架。我们的方法不直接查看生成模型内部,而是通过读取已生成的文本,借助小型本地托管的开放权重模型读取其内部激活来识别幻觉。这无论生成模型是闭源 API(如 GPT-4)还是开放权重模型都同样有效。我们构建了 18 项特征,这些特征基于 Transformer 处理文本的方式,涵盖残差流范数、每个注意力头来源文档注意力、熵、MLP 激活、logit-lens 轨迹以及三项新的 token 级 grounding 统计。我们在 72,135 个样本上进行堆栈集成训练,来自五个幻觉数据集。我们测试了七种分析器架构,参数规模从 5 亿到 90 亿不等:Qwen2.5 0.5B 和 7B、Gemma-2 2B 和 9B、Pythia 1.4B、LLaMA-3 3B 和 8B。在所有七种模型中,我们在 RAGTruth 上将 ReDeEP 的 token 级 AUC 从 0.73 提升了 7.4-10.3 个百分点。Qwen2.5-7B 达到 F1 为 0.717,略高于 ReDeEP 的 0.713,Qwen2.5-0.5B 达到 0.706。最引人注目的是所有七种模型高度紧密聚类:在 18 倍模型规模差异下,AUC 仅相隔 2.3 个百分点。更令人惊讶的是,我们 3B LLaMA 在 RAGTruth 上超过了 8B LLaMA,表明在同一模型家族中,更大并不一定总是更好。由于 RAGTruth 和 LLM-AggreFact 都包含来自多个 LLM 家族的输出,因此我们的结果并未偏向特定生成器。
引用
@article{arxiv.2605.07209,
title = {Hallucination Detection via Activations of Open-Weight Proxy Analyzers},
author = {Akshita Singh and Prabesh Paudel and Siddhartha Roy},
journal= {arXiv preprint arXiv:2605.07209},
year = {2026}
}
备注
12 pages, 4 figures. Code available at https://github.com/hallu-detect/llm_hallucination_detection