中文

DRIFT:检测事实真实性的表示性不一致

计算与语言 2026-01-30 v2

摘要

大型语言模型(LLM)常产出流畅却不正确的答案,而检测此类幻觉(hallucination)通常需要多次采样或事后验证,增加显著延迟和成本。我们假设中间层编码的置信信号在最终输出层中被丢弃,并提出一种轻量级探针直接从隐藏状态读取这些信号。该探针仅增加不到 0.1\% 的计算开销,可在生成期间完全并行运行,从而在答案生成前进行幻觉检测。基于此,我们开发了一个 LLM 路由器,在对查询足够自信时立即作答,而将不确定的查询委托给更强大的模型。尽管方法简单,我们在四个 QA 基准测试和三个 LLM 系列的 12 个设置中实现了 SOTA AUROC,其中 10 个设置取得突破性成绩,相较于先前方法提升最高可达 13 分,并且在无需重新训练的情况下可跨数据集漂移进行泛化。

关键词

引用

@article{arxiv.2601.14210,
  title  = {DRIFT: Detecting Representational Inconsistencies for Factual Truthfulness},
  author = {Rohan Bhatnagar and Youran Sun and Chi Andrew Zhang and Yixin Wen and Haizhao Yang},
  journal= {arXiv preprint arXiv:2601.14210},
  year   = {2026}
}