面向大型语言模型 hallucination 检测的图信号处理框架
计算与语言
2025-10-23 v1 机器学习
信号处理
机器学习
摘要
大型语言模型取得了令人印象深刻的结果,但区分事实推理与幻觉仍然具有挑战性。我们提出了一个谱分析框架,将Transformer层建模为由注意力机制产生的动态图,将token嵌入视为这些图上的信号。通过图信号处理,我们定义了诊断性指标,包括Dirichlet能量、谱熵和高频能量比率,并与计算稳定性理论建立联系。跨GPT架构的实验表明,存在普遍的谱模式:事实陈述表现出一致的“能量山”行为,呈现低频收敛;而不同类型的幻觉则显示出各异的特征。逻辑矛盾导致谱图不稳定,效应规模较大(),语义错误保持稳定但显示出连接性漂移,替代式幻觉呈现中间级扰动。使用谱特征的简单检测器相较于困惑度基准的75%检测准确率,实现了88.75%的准确率,证明了其实际效用。这些发现表明,谱几何可能捕捉推理模式和错误行为,为大型语言模型的幻觉检测提供了框架。
关键词
引用
@article{arxiv.2510.19117,
title = {A Graph Signal Processing Framework for Hallucination Detection in Large Language Models},
author = {Valentin Noël},
journal= {arXiv preprint arXiv:2510.19117},
year = {2025}
}
备注
Preprint under review (2025). 11 pages, 7 figures. Code and scripts: to be released