FaithBench:现代大语言模型摘要的多样化幻觉基准
计算与语言
2024-10-18 v1 人工智能
摘要
摘要是大语言模型执行的主要任务之一,尤其是在检索增强生成等应用中。然而,现有的针对大语言模型生成摘要的幻觉评估,以及幻觉检测模型的评估,在所考虑的大语言模型及其模型家族方面都缺乏多样性和时效性。本文介绍了 FaithBench,一个摘要幻觉基准,包含由 8 个不同家族的 10 个现代大语言模型产生的具有挑战性的幻觉,并由人类专家提供真实标注。这里的“具有挑战性”指的是那些最先进的幻觉检测模型(包括 GPT-4o 作为评判者)意见不一致的摘要。我们的结果显示,GPT-4o 和 GPT-3.5-Turbo 产生的幻觉最少。然而,即使是最先进的幻觉检测模型在 FaithBench 上的准确率也接近 50%,这表明仍有很大的改进空间。代码仓库位于 https://github.com/vectara/FaithBench
引用
@article{arxiv.2410.13210,
title = {FaithBench: A Diverse Hallucination Benchmark for Summarization by Modern LLMs},
author = {Forrest Sheng Bao and Miaoran Li and Renyi Qu and Ge Luo and Erana Wan and Yujia Tang and Weisi Fan and Manveer Singh Tamber and Suleman Kazi and Vivek Sourabh and Mike Qi and Ruixuan Tu and Chenyu Xu and Matthew Gonzales and Ofer Mendelevitch and Amin Ahmad},
journal= {arXiv preprint arXiv:2410.13210},
year = {2024}
}