真理的几何学:面向大语言模型 hallucination 检测的层级语义动力学
计算与语言
2025-10-07 v1 人工智能
信息论
机器学习
神经与进化计算
math.IT
摘要
大语言模型 (LLM) 常常生成流畅却带有事实错误的陈述——即所谓的 hallucination——在高风险领域引发严重风险。我们提出 Layer-wise Semantic Dynamics (LSD),一种用于 hallucination 检测的几何框架,通过分析 transformer 各层隐藏状态语义的演变。不同于依赖多次抽样或外部验证来源的先前方法,LSD 在模型的表示空间内自主运行。通过基于边际的对比学习,LSD 将隐藏激活与由事实编码器派生的真实嵌入对齐,揭示事实性响应在语义轨迹上保持稳定的对齐,而 hallucination 则在深度上表现出显著的语义漂移。评估于 TruthfulQA 和合成事实-hallucination 数据集,LSD 在 F1 分数达到 0.92、AUROC 达到 0.96 和聚类准确率达到 0.89,超越 SelfCheckGPT 和语义熵基线,同时只需一次前向传播。这种效率使其在不牺牲精度或可解释性的前提下,相较于基于抽样的方法实现 5-20 倍的加速。LSD 提供了一种可扩展且与模型无关的实时 hallucination 监控机制,为深入理解大语言模型内部事实一致性的几何性质提供了新见解。
引用
@article{arxiv.2510.04933,
title = {The Geometry of Truth: Layer-wise Semantic Dynamics for Hallucination Detection in Large Language Models},
author = {Amir Hameed Mir},
journal= {arXiv preprint arXiv:2510.04933},
year = {2025}
}
备注
Comments: 14 pages, 14 figures, 5 tables. Code available at: https://github.com/sirraya-tech/Sirraya_LSD_Code