幻觉排行榜——衡量大型语言模型中幻觉现象的开放倡议
计算与语言
2024-04-18 v2
摘要
大型语言模型(LLM)以其理解并生成类人文本的卓越能力,改变了自然语言处理(NLP)领域的格局。然而,这些模型容易产生“幻觉”——即与事实真相或输入上下文不符的输出。本文介绍了幻觉排行榜,这是一个定量测量并比较各模型产生幻觉倾向的开放倡议。该排行榜使用了一套全面的基准测试,聚焦于各种任务中幻觉的不同方面(如事实性与忠实度),包括问答、摘要和阅读理解。我们的分析提供了关于不同模型性能的见解,以指导研究人员和从业者为其应用选择最可靠的模型。
引用
@article{arxiv.2404.05904,
title = {The Hallucinations Leaderboard -- An Open Effort to Measure Hallucinations in Large Language Models},
author = {Giwon Hong and Aryo Pradipta Gema and Rohit Saxena and Xiaotang Du and Ping Nie and Yu Zhao and Laura Perez-Beltrachini and Max Ryabinin and Xuanli He and Clémentine Fourrier and Pasquale Minervini},
journal= {arXiv preprint arXiv:2404.05904},
year = {2024}
}