中文

将检索与思维链推理交错用于知识密集型多步问答

计算与语言 2023-06-26 v2

摘要

基于提示的大型语言模型(LLM)在为多步问答(QA)生成自然语言推理步骤或思维链(CoT)方面表现出惊人的能力。然而,当所需知识对 LLM 不可用或在其参数中未更新时,它们便会遇到困难。虽然使用问题从外部知识源检索相关文本对 LLM 有所帮助,但我们观察到这种单步“检索-阅读”方法不足以应对多步 QA。在此,\textit{检索什么}取决于\textit{已经推导出什么},而后者又可能取决于\textit{之前检索到什么}。为解决这一问题,我们提出了 IRCoT,一种用于多步 QA 的新方法,它将检索与 CoT 中的步骤(句子)交错进行,以 CoT 引导检索,进而利用检索结果改进 CoT。在四个数据集(HotpotQA、2WikiMultihopQA、MuSiQue 和 IIRC)上,将 IRCoT 与 GPT3 结合使用,显著提高了检索效果(提升达 21 个百分点)以及下游 QA 性能(提升达 15 个百分点)。我们在分布外(OOD)设置以及无需额外训练的更小模型(如 Flan-T5-large)上也观察到类似的显著提升。IRCoT 减少了模型幻觉,从而产生事实更为准确的 CoT 推理。代码、数据和提示可在 \url{https://github.com/stonybrooknlp/ircot} 获取

关键词

引用

@article{arxiv.2212.10509,
  title  = {Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions},
  author = {Harsh Trivedi and Niranjan Balasubramanian and Tushar Khot and Ashish Sabharwal},
  journal= {arXiv preprint arXiv:2212.10509},
  year   = {2023}
}

备注

ACL'23 Camera Ready