中文

DiaHalu:面向大型语言模型的对话级幻觉评估基准

计算与语言 2024-10-11 v3 人工智能

摘要

由于大型语言模型(LLM)近年来取得了巨大成功,幻觉问题仍然是一个挑战,人们提出了许多基准来检测幻觉。然而,其中一些基准并非由 LLM 自然生成,而是被故意诱导的。此外,许多基准仅关注事实性幻觉而忽略了忠实性幻觉。另外,尽管对话模式在 LLM 时代被更广泛地使用,但当前的基准仅集中在句子级和段落级幻觉上。在本研究中,我们提出了 DiaHalu,据我们所知,这是第一个对话级幻觉评估基准。最初,我们将收集到的主题整合到系统提示中,并促进两个 ChatGPT3.5 之间的对话。随后,我们手动修改不符合人类语言习惯的内容,然后让 LLM 重新生成,以模拟真实的人机交互场景。最后,专业学者对数据集中的所有样本进行标注。DiaHalu 涵盖了四个常见的多轮对话领域和五种幻觉子类型,由事实性幻觉和忠实性幻觉扩展而来。通过一些知名的 LLM 和检测方法在该数据集上的实验表明,DiaHalu 是一个具有挑战性的基准,对进一步研究具有重要价值。

关键词

引用

@article{arxiv.2403.00896,
  title  = {DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models},
  author = {Kedi Chen and Qin Chen and Jie Zhou and Yishen He and Liang He},
  journal= {arXiv preprint arXiv:2403.00896},
  year   = {2024}
}