中文

FreshLLMs:利用搜索引擎增强刷新大语言模型

计算与语言 2023-11-23 v2

摘要

大多数大语言模型(LLMs)只训练一次且从不更新;因此,它们缺乏动态适应不断变化的世界的能力。在这项工作中,我们针对测试当前世界知识的问答场景,详细研究了LLM生成文本的事实性。具体而言,我们引入了FreshQA,一个新颖的动态QA基准,涵盖多种问答类型,包括需要快速变化世界知识的问题以及需要被揭穿的错误前提问题。我们在一种双模式评估流程下对多种闭源和开源LLM进行基准测试,该流程使我们能够同时衡量正确性和幻觉。通过涉及超过5万次判断的人工评估,我们揭示了这些模型的局限性并展示了显著的改进空间:例如,所有模型(无论模型大小)都在涉及快速变化知识和错误前提的问题上表现不佳。受这些结果启发,我们提出FreshPrompt,一种简单的少样本提示方法,通过将从搜索引擎检索到的相关且最新的信息纳入提示,显著提升了LLM在FreshQA上的表现。我们的实验表明,FreshPrompt优于竞争性的搜索引擎增强提示方法(如Self-Ask(Press等人,2022))以及商业系统(如Perplexity.AI)。对FreshPrompt的进一步分析表明,检索证据的数量及其顺序对LLM生成答案的正确性起着关键作用。此外,与鼓励更冗长答案相比,指示LLM生成简洁直接的答案有助于减少幻觉。为促进未来工作,我们在github.com/freshllms/freshqa发布FreshQA,并承诺定期更新。

关键词

引用

@article{arxiv.2310.03214,
  title  = {FreshLLMs: Refreshing Large Language Models with Search Engine Augmentation},
  author = {Tu Vu and Mohit Iyyer and Xuezhi Wang and Noah Constant and Jerry Wei and Jason Wei and Chris Tar and Yun-Hsuan Sung and Denny Zhou and Quoc Le and Thang Luong},
  journal= {arXiv preprint arXiv:2310.03214},
  year   = {2023}
}

备注

Preprint, 26 pages, 10 figures, 5 tables; Added FreshEval