中文

小型语言模型幻觉的几何分析

计算与语言 2026-05-20 v3 人工智能 计算机与社会

摘要

幻觉——看似合理但事实不正确的回答——是大型语言模型可靠性面临的主要挑战,尤其是在多步骤或代理设置中。现有工作大多将幻觉视为知识缺失的结果;我们则表明,即使相关事实知识存在,模型仍会产生幻觉回答,这表明问题在于检索不稳定而非知识缺失。基于这一观察,我们引入了 APORIA(Aggregate Prompt-wise Observation Retrieving Instability via Asymmetry——幻觉所体现的“在矛盾中困惑状态”),一个几何框架,用于研究同一提示在句子嵌入空间中的重复响应。我们的核心假设是,真实响应比幻觉响应更紧密地聚集;我们实证验证了这一点,并表明在进行 Fisher 投影后,这两种响应类别能够一致地被分离。我们利用这种几何不对称性,通过 APORIA-LP(一种高效的标签传播方法)对来自仅 30--50 项标注的大量模型响应进行分类,实现了在十个小型语言模型上 F1 分数超过 90%。为支持进一步的研究,我们发布了 SOCRATES-300K,一个标注完整的 30 万条响应数据集,以及用于数据生成和结果复现的代码。我们的关键发现——从嵌入空间的几何视角考察幻觉——补充了传统的知识导向和单次响应评估范式,为进一步的研究指明了方向。

关键词

引用

@article{arxiv.2602.14778,
  title  = {A Geometric Analysis of Small-sized Language Model Hallucinations},
  author = {Emanuele Ricco and Elia Onofri and Lorenzo Cima and Stefano Cresci and Roberto Di Pietro},
  journal= {arXiv preprint arXiv:2602.14778},
  year   = {2026}
}

备注

30 pages, 12 figures, 14 tables, accepted as regular paper at ICML'26