中文

HalluSAE:基于稀疏自编码器检测大语言模型中的幻觉现象

计算与语言 2026-04-21 v1 人工智能

摘要

大语言模型(LLM)功能强大且广泛应用,但因其已知的幻觉现象而在实际应用中受到限制。虽然近期的幻觉检测方法取得了显著进展,但我们发现大多数方法忽略了幻觉现象的动态本质及其内在机制。为此,我们提出了 HalluSAE,一个受相位转变启发的框架,将幻觉建模为模型潜在动力学中的临界转移。通过将生成过程建模为穿越势能景观的轨迹,HalluSAE 识别出关键转移区域,并将事实错误归因于特定高能稀疏特征。我们的方法包含三个阶段:(1)基于稀疏自编码器和几何势能度量的势能增强相位区域定位;(2)基于对比逻辑归因的幻觉相关稀疏特征归因;(3)基于离析特征的探针式因果幻觉检测。对 Gemma-2-9B 进行的大量实验表明,HalluSAE 在幻觉检测方面实现了业界领先的性能。

关键词

引用

@article{arxiv.2604.16430,
  title  = {HalluSAE: Detecting Hallucinations in Large Language Models via Sparse Auto-Encoders},
  author = {Boshui Chen and Zhaoxin Fan and Ke Wang and Zhiying Leng and Faguo Wu and Hongwei Zheng and Yifan Sun and Wenjun Wu},
  journal= {arXiv preprint arXiv:2604.16430},
  year   = {2026}
}