语言模型会产生幻觉,但或擅长事实核查
计算与语言
2024-03-22 v2
摘要
自然语言处理(NLP)的近期进展很大程度上归功于大语言模型(LLMs)的显著进步。然而,LLMs 频繁“幻觉”,导致非事实输出。我们精心设计的人工评估证实了严重的幻觉问题,揭示即便 GPT-3.5 产生事实性输出的比例也低于 25%。这凸显了事实核查器对于衡量并激励进展的重要性。我们的系统性研究确认,LLMs 可被重新用作有效的事实核查器,且与人类判断高度相关。令人惊讶的是,我们研究中事实性最弱的生成模型 FLAN-T5-11B 作为事实核查器表现最佳,甚至超越 GPT3.5 和 ChatGPT 等能力更强的 LLMs。进一步深入,我们分析这些 LLMs 对高质量证据的依赖,以及其在鲁棒性与泛化能力上的不足。我们的研究为开发可信生成模型提供了见解。
引用
@article{arxiv.2310.14564,
title = {Language Models Hallucinate, but May Excel at Fact Verification},
author = {Jian Guan and Jesse Dodge and David Wadden and Minlie Huang and Hao Peng},
journal= {arXiv preprint arXiv:2310.14564},
year = {2024}
}
备注
Accepted in NAACL 2024