利用注意力图谱的谱特征检测 LLM 中的幻觉
机器学习
2025-10-21 v2 人工智能
计算与语言
摘要
大型语言模型(LLMs)在各种任务中展现出了卓越的性能,但仍然容易产生幻觉。检测幻觉对于安全关键应用至关重要,最近的方法利用注意力图谱属性来实现这一目标,但其有效性仍然有限。在这项工作中,我们通过将注意力图谱解释为图结构的邻接矩阵来研究其谱特征。我们提出了 方法,该方法利用从注意力图谱导出的拉普拉斯矩阵的 top- 特征值作为幻觉检测探针的输入。实证评估表明,我们的方法在基于注意力的方法中实现了 SOTA 的幻觉检测性能。广泛的消融研究进一步突显了 的鲁棒性和泛化能力,为幻觉检测领域的未来进展铺平了道路。
引用
@article{arxiv.2502.17598,
title = {Hallucination Detection in LLMs Using Spectral Features of Attention Maps},
author = {Jakub Binkowski and Denis Janiak and Albert Sawczyn and Bogdan Gabrys and Tomasz Kajdanowicz},
journal= {arXiv preprint arXiv:2502.17598},
year = {2025}
}
备注
Accepted to EMNLP 2025. Code available at https://github.com/graphml-lab-pwr/lapeigvals