中文

基于层级信息不足检测大语言模型幻觉:对模糊提示和不可答问题的分析

机器学习 2025-10-07 v2

摘要

大型语言模型(LLMs)经常生成充满信心却不准确的响应,在安全关键领域的部署中引入了重大风险。我们提出了一种新的测试时方法,通过系统性分析跨模型层的信息流来检测模型幻觉。我们针对LLMs处理带有模糊或不足上下文的输入的情况进行研究。我们的调查发现,幻觉表现为跨层传输中可用信息的不足。虽然现有方法主要关注最终层的输出分析,但我们展示了跟踪跨层信息动态(L\mathcal{L}I)提供了稳健的模型可靠性指标,这在计算过程中考虑了信息的获取与损失。L\mathcal{L}I能够轻松集成到预训练的大语言模型中,而无需额外的训练或架构修改。

关键词

引用

@article{arxiv.2412.10246,
  title  = {Detecting LLM Hallucination Through Layer-wise Information Deficiency: Analysis of Ambiguous Prompts and Unanswerable Questions},
  author = {Hazel Kim and Tom A. Lamb and Adel Bibi and Philip Torr and Yarin Gal},
  journal= {arXiv preprint arXiv:2412.10246},
  year   = {2025}
}

备注

Accepted to EMNLP(main)2025