LLM幻觉的几何分类学
人工智能
2026-05-11 v3 计算与语言
摘要
在医疗、法律和金融等领域的实际应用中,语言模型的幻觉可能对下游决策产生实际影响。在生产环境中,检测必须运行在部署系统可见的内容上:查询、响应以及常用的来源文档。针对第三方API后不可获得的白盒模型内部访问和多样本查询。在此设置下——黑盒、单次、仅限问答可用——占主导基准为NLI,该方法返回一个值但在失败时不提供诊断。我们认为,直接在嵌入空间的几何上进行操作可提供检测方法,其成功与失败可解释为对对比句子编码训练结构属性。我们的贡献在于:给定一个以操作为导向的分类学,几何预测哪些类型的幻觉可被检测,哪些不可被检测——且预测成立。我们提出了三个操作类型,依据响应嵌入与以 grounded 响应为准人类区域(单位球面)上关系:(1)查询接近的不忠可通过角比检测; (2)越过准人类区域的妄想产生方向性信号,在专家标注错误方面超越NLI; (3)与正确答案共享词汇和框架的事实错误不可通过角几何分离。为验证在贴近部署的内容上,我们构建了一个跨越九个领域的212对人类妄想数据集,使用诱发妄想。
引用
@article{arxiv.2602.13224,
title = {A Geometric Taxonomy of Hallucinations in LLMs},
author = {Javier Marín},
journal= {arXiv preprint arXiv:2602.13224},
year = {2026}
}