中文

说谎给我:面向 LLM 幻觉自检测的知识图谱

计算与语言 2025-12-30 v1 人工智能

摘要

幻觉——看似令人信服却发表虚假陈述的现象,仍是 LLM 安全部署的主要障碍。基于自检方法的卓越表现,我们检视了使用结构化知识表示——即知识图谱——来提高幻觉自检测性能的潜力。具体而言,我们提出一种简单而强大的方法,通过(i)将 LLM 响应转换为实体和关系的知识图谱,(ii)使用这些图谱来估计响应包含幻觉的可能性。我们针对两个广泛使用的 LLM(GPT-4o 和 Gemini-2.5-Flash)以及两个常用的幻觉检测数据集,对所提方法进行评估。为支持更可靠的未来基准测试,本工作的次要结果之一数据集已手动精选并增强,随即公开。与标准自检方法和 SelfCheckGPT(一种最先进的方法)相比,我们的方法在准确率上提升最高可达 16%,F1 分数提升最高可达 20%。我们的结果表明,LLM 在将原子事实结构化为知识图谱后,能够更好地分析这些事实,即使最初输出包含不准确信息也是如此。这一低成本、模型无关的方法为更安全更可信的语言模型铺平了道路。

关键词

引用

@article{arxiv.2512.23547,
  title  = {Lie to Me: Knowledge Graphs for Robust Hallucination Self-Detection in LLMs},
  author = {Sahil Kale and Antonio Luca Alfeo},
  journal= {arXiv preprint arXiv:2512.23547},
  year   = {2025}
}

备注

Accepted to ICPRAM 2026 in Marbella, Spain