中文

MultiHal: 面向知识图谱驱动 LLM 幻觉评估的多语言数据集

计算与语言 2025-10-24 v2

摘要

大语言模型 (LLM) 存在忠诚性和事实性局限性, 常被称为幻觉。已develop several benchmarks 为事实性评估提供测试平台, 但这些基准在英语中心语境中进行, 依赖 web 链接或文本段落等补充信息, 忽略了可用的结构化事实资源。为此, 已识别知识图谱 (KG) 作为缓解幻觉的有用工具, 因其提供以最少语言开销表示实体及其关系的结构化方式。我们填补现有幻觉评估基准中缺乏 KG 路径和多语言性的问题, 提出一种称为 MultiHal 的 KG 基于、多跳、多语言基准, 用于生成式文本评估。在数据收集管道中, 我们从开放领域 KG 中挖掘 14 万条 KG 路径, 然后修剪噪声 KG 路径, 精选出高质量子集的 25.9k 条。我们的基线评估显示, 在 KG-RAG 相对于 vanilla QA 中, 跨多语言和多模型, 语义相似度提升约 0.12~0.36 分, NLI entailment 提升 0.16~0.36 分, 幻觉检测提升 0.29~0.42 分, 证明了 KG 集成的潜力。我们预计 MultiHal 将促进未来研究向多个基于图的幻觉缓解和事实核查任务发展。

关键词

引用

@article{arxiv.2505.14101,
  title  = {MultiHal: Multilingual Dataset for Knowledge-Graph Grounded Evaluation of LLM Hallucinations},
  author = {Ernests Lavrinovics and Russa Biswas and Katja Hose and Johannes Bjerva},
  journal= {arXiv preprint arXiv:2505.14101},
  year   = {2025}
}