中文

INSIDE:LLM的内部状态保留幻觉检测能力

计算与语言 2024-10-22 v2

摘要

知识幻觉已引起人们对已部署LLM的安全性和可靠性的广泛关注。先前在检测幻觉方面的工作主要采用logit级别的不确定性估计或语言级别的自一致性评估,其中语义信息在令牌解码过程中不可避免地丢失。因此,我们提出探索LLM内部状态中保留的密集语义信息用于幻觉检测(INSIDE)。具体来说,我们提出了一种简单而有效的EigenScore度量来更好地评估响应的自一致性,该度量利用响应协方差矩阵的特征值来衡量密集嵌入空间中的语义一致性/多样性。此外,从自一致性幻觉检测的角度,我们探索了一种测试时特征裁剪方法,以截断内部状态中的极端激活,从而减少过度自信的生成,并可能有助于检测过度自信的幻觉。在几个流行的LLM和问答(QA)基准上进行了大量实验和消融研究,证明了我们方法的有效性。

关键词

引用

@article{arxiv.2402.03744,
  title  = {INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection},
  author = {Chao Chen and Kai Liu and Ze Chen and Yi Gu and Yue Wu and Mingyuan Tao and Zhihang Fu and Jieping Ye},
  journal= {arXiv preprint arXiv:2402.03744},
  year   = {2024}
}

备注

Accepted by ICLR-2024