WildHallucinations: 评估基于真实世界实体查询的大语言模型长篇事实性
计算与语言
2024-07-25 v1 人工智能
摘要
尽管大型语言模型(LLM)的幻觉现象作为主要挑战存在,但现有事实性评估基准未覆盖真实世界用户寻求信息的多样化知识领域。为弥合这一差距,我们引入WildHallucinations基准,评估事实性。该基准通过提示LLM生成关于从野生聊天机器人对话中挖掘的实体的情报。这些生成内容随后被自动fact-checked,其依据是来自网络搜索的系统性精选知识来源。值得注意的是,这些真实世界实体的一半没有关联的维基百科页面。我们对15个LLM的118,785次生成进行评估,涉及7,919个实体。我们发现,LLM在没有维基百科页面的实体上幻觉率始终更高,且在不同领域表现出不同的幻觉率。最后,尽管添加检索组件仅略微减少幻觉,但未消除幻觉。
引用
@article{arxiv.2407.17468,
title = {WildHallucinations: Evaluating Long-form Factuality in LLMs with Real-World Entity Queries},
author = {Wenting Zhao and Tanya Goyal and Yu Ying Chiu and Liwei Jiang and Benjamin Newman and Abhilasha Ravichander and Khyathi Chandu and Ronan Le Bras and Claire Cardie and Yuntian Deng and Yejin Choi},
journal= {arXiv preprint arXiv:2407.17468},
year = {2024}
}