CausalGaze:通过结构因果模型中的反事实图干预揭示幻觉
机器学习
2026-05-12 v3
摘要
尽管大型语言模型(LLMs)取得了突破性进展,但幻觉仍是其在高风险领域部署的关键瓶颈。现有基于分类的方法主要依赖来自内部状态的静态和被动信号,这些信号常常捕获噪声和伪相关,同时忽略底层因果机制。为此,我们将范式从被动观察转向主动干预,通过引入基于结构因果模型(SCMs)的CausalGaze,一种新的幻觉检测框架。CausalGaze将LLMs的内部状态建模为动态因果图,并采用反事实干预来分离因果推理路径与偶然噪声,从而增强模型的可解释性。跨四个数据集和三个广泛使用的LLMs的大量实验表明,CausalGaze的有效性,尤其在TruthfulQA数据集上相对于最先进的基线实现了3.3%的AUROC提升。
引用
@article{arxiv.2604.11087,
title = {CausalGaze: Unveiling Hallucinations via Counterfactual Graph Intervention in Large Language Models},
author = {Linggang Kong and Lei Wu and Yunlong Zhang and Xiaofeng Zhong and Zhen Wang and Yongjie Wang and Yao Pan},
journal= {arXiv preprint arXiv:2604.11087},
year = {2026}
}
备注
Accepted as ACL2026 Findings