中文

通过扰动揭示:基于扰动的 LLM 幻觉检测

人工智能 2025-06-04 v1

摘要

幻觉仍是大型语言模型(LLM)在现实世界问答任务中可靠部署的关键障碍。一种广泛采用的检测幻觉的策略是自我评估,它依赖模型自身的输出置信度来估计其答案的事实准确性。然而,该策略假设模型的输出分布紧密反映真实数据分布,这在实践中并不总是成立。随着偏差在模型各层中累积,最终输出可能偏离底层的推理过程,使得输出级置信度成为幻觉检测的不可靠信号。在本工作中,我们提出样本特定提示(SSP),一种通过分析中间表示的扰动敏感性来改进自我评估的新框架。这些表示较少受模型偏差影响,提供了对模型潜在推理过程更忠实的视角。具体而言,SSP 为每个输入动态生成噪声提示,并采用轻量级编码器放大由扰动引起的表示变化。随后使用对比距离度量来量化这些差异,并将真实响应与幻觉响应分离。通过利用中间表示在扰动下的动态行为,SSP 实现了更可靠的自我评估。大量实验表明,SSP 在一系列幻觉检测基准测试中显著优于先前的方法。

关键词

引用

@article{arxiv.2506.02696,
  title  = {Shaking to Reveal: Perturbation-Based Detection of LLM Hallucinations},
  author = {Jinyuan Luo and Zhen Fang and Yixuan Li and Seongheon Park and Ling Chen},
  journal= {arXiv preprint arXiv:2506.02696},
  year   = {2025}
}