基于注意力图的神经消息传递用于幻觉检测
机器学习
2025-09-30 v1
摘要
大型语言模型(LLM)经常生成错误或无依据的内容,这被称为幻觉。现有的检测方法依赖于启发式规则或基于孤立计算轨迹(如激活值或注意力图)的简单模型。我们通过将这些信号表示为属性图来统一它们,其中词元为节点,边遵循注意力流,且两者均携带来自注意力分数和激活值的特征。我们的方法 CHARM 将幻觉检测转化为图学习任务,并通过在上述属性图上应用图神经网络(GNN)来解决该任务。我们证明 CHARM 在理论上包含先前的基于注意力的启发式方法,并且在实验上,它在各种基准测试中始终优于其他领先方法。我们的结果揭示了图结构的相关作用以及结合计算轨迹的益处,同时表明 CHARM 在跨数据集迁移中展现出有前景的零样本性能。
引用
@article{arxiv.2509.24770,
title = {Neural Message-Passing on Attention Graphs for Hallucination Detection},
author = {Fabrizio Frasca and Guy Bar-Shalom and Yftah Ziser and Haggai Maron},
journal= {arXiv preprint arXiv:2509.24770},
year = {2025}
}
备注
Preprint. 25 pages, 2 figures