HalluVerse25:面向 LLM 幻觉的细粒度多语言基准数据集
计算与语言
2025-03-12 v1 人工智能
摘要
大语言模型(LLM)在 various contexts 中日益广泛地使用,但仍容易生成非事实内容,通常称为“幻觉”。文献将幻觉分为几类,包括实体级、关系级和句子级幻觉。然而,现有的幻觉数据集往往未能捕捉多语言环境下的细粒度幻觉。本文介绍 HalluVerse25,一个用于 LLM 幻觉的多语言数据集,涵盖英文、阿拉伯语和土耳其语中的细粒度幻觉。我们的数据集构建管道使用 LLM 将事实人物简介中的事实内容注入幻觉,然后经过严格的人类标注过程以确保数据质量。我们在 HalluVerse25 上评估了多个 LLM,为洞察专有模型在不同情境下检测 LLM 生成的幻觉性能提供了宝贵见解。
引用
@article{arxiv.2503.07833,
title = {HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations},
author = {Samir Abdaljalil and Hasan Kurban and Erchin Serpedin},
journal= {arXiv preprint arXiv:2503.07833},
year = {2025}
}