中文

基于嵌入聚类几何检测 LLM 幻觉:三类类型分类学及可测量特征

计算与语言 2026-02-17 v1

摘要

我们提出了一种基于令牌嵌入聚类结构中可观察特征的大语言模型幻觉几何分类学。通过分析11个Transformer模型的静态嵌入空间,这些模型涵盖编码器 (BERT, RoBERTa, ELECTRA, DeBERTa, ALBERT, MiniLM, DistilBERT) 和解码器 (GPT-2) 架构,我们识别出三种操作上distinct的幻觉类型:类型1(中心漂移)在弱上下文下,类型2(错误一致收敛)收敛到局部连贯但情境不正确的聚类区域,类型3(覆盖缺口)不存在聚类结构。我们引入了三个可测量的几何统计量:α(极性耦合)、β(聚类内聚性)和λ_s(径向信息梯度)。在所有11个模型中,极性结构(α > 0.5)普遍存在(11/11),聚类内聚性(β > 0)普遍存在(11/11),径向信息梯度显著(9/11,p < 0.05)。我们展示了两个未通过λ_s显著性检验的模型——ALBERT和MiniLM——其原因可从架构中解释:ALBERT采用因子化嵌入压缩,MiniLM采用蒸馏导致各向同性。这些发现确立了类型特定幻觉检测的几何先决条件,并关于架构依赖性脆弱性轮廓作出可测试的预测。

关键词

引用

@article{arxiv.2602.14259,
  title  = {Detecting LLM Hallucinations via Embedding Cluster Geometry: A Three-Type Taxonomy with Measurable Signatures},
  author = {Matic Korun},
  journal= {arXiv preprint arXiv:2602.14259},
  year   = {2026}
}

备注

9 pages, 5 figures