中文

FactCheckmate: 先行检测与缓解语言模型幻觉

计算与语言 2025-06-26 v2

摘要

语言模型会产生幻觉现象。我们思考:我们能否在幻觉发生前检测并缓解它们?本工作肯定回答了这个问题,表明语言模型的内部表示提供了可用于此目的的丰富信号。我们引入 FactCheckmate,通过学习一个分类器来预测语言模型是否会产生幻觉,基于解码开始前输入产生的模型隐藏状态。若检测到幻觉,FactCheckmate 便通过调整语言模型的隐藏状态,以使模型产生更具事实性的输出。FactCheckmate 提供了关于语言模型内部工作如何通过其隐藏状态揭示的新见解。实际上,其检测和缓解模型都轻量级,推理开销极小;FactCheckmate 证明是比许多事后方法更高效的幻觉缓解方案。我们在不同规模和模型家族(包括 Llama、Mistral、Qwen 和 Gemma)上评估了 FactCheckmate,涵盖来自不同领域的各种 QA 数据集。我们的结果表明 FactCheckmate 有效,实现了超过 70% 的先行检测准确率。在无干预的情况下生成的输出与通过干预生成的输出相比,平均提高了 34.4% 的事实性。

关键词

引用

@article{arxiv.2410.02899,
  title  = {FactCheckmate: Preemptively Detecting and Mitigating Hallucinations in LMs},
  author = {Deema Alnuhait and Neeraja Kirtane and Muhammad Khalifa and Hao Peng},
  journal= {arXiv preprint arXiv:2410.02899},
  year   = {2025}
}