中文

为LLM生成答案检索支撑证据

信息检索 2023-06-27 v1

摘要

当前大语言模型(LLMs)在许多自然语言任务(包括开放域问答)上可展现出接近人类的性能水平。遗憾的是,它们也会令人信服地幻觉出错误答案,因此在未经外部来源核实前,不能轻信其对问题的回复。本文报告了一个简单实验,用于针对语料库自动核实生成答案。向LLM提出问题并收到生成答案后,我们以问题+生成答案的组合查询语料库。随后将问题+生成答案+检索答案的组合呈现给LLM,提示其指出生成答案是否可由检索答案支撑。我们的实验基于MS MARCO (V1)测试集的问题与段落,探索了从标准BM25到完整问答栈(包括基于LLM的阅读器)的三种检索方法。对于大部分问题,我们发现若有恰当的支撑材料,LLM能够核实其生成答案。然而,由于准确率为70-80%,该方法不能完全依赖以检测幻觉。

关键词

引用

@article{arxiv.2306.13781,
  title  = {Retrieving Supporting Evidence for LLMs Generated Answers},
  author = {Siqing Huo and Negar Arabzadeh and Charles L. A. Clarke},
  journal= {arXiv preprint arXiv:2306.13781},
  year   = {2023}
}