基于计划评估的最远推理:检索增强大语言模型的稳定推理路径
计算与语言
2023-09-25 v1
摘要
大语言模型(LLMs)作为强大的推理器与生成器,在问答(QA)等多种自然语言任务中展现出卓越性能。其中,多跳问答(MHQA)是一类被广泛讨论的任务,需要 LLM 与外部知识检索的无缝整合。现有方法利用 LLM 生成推理路径与计划,并采用 IR 迭代检索相关知识,但这些方法存在固有缺陷。一方面,信息检索器(IR)受限于 LLM 所生成查询的低质量。另一方面,LLM 易被 IR 检索到的无关知识误导。这些由 IR 与 LLM 迭代交互累积的错误,最终导致效果上的灾难。为克服上述障碍,本文提出一种用于 MHQA 的新颖流水线,称为最远推理与计划评估(FuRePA),包含一个改进框架(最远推理)与一个附加模块(计划评估器)。1)最远推理通过对 LLM 屏蔽先前的推理路径与生成的查询,鼓励 LLM 在每次迭代中从零开始生成思维链。该方法使 LLM 能够打破由先前误导性思维与查询(若有)构筑的枷锁。2)计划评估器是一个经训练的评价器,从 LLM 提出的一组候选计划中选择合适计划。我们的方法在三个广受认可的公有多跳问答数据集上接受评估,并在多数指标上超越 SOTA(在答案准确率上取得 10%–12% 的提升)。
引用
@article{arxiv.2309.12767,
title = {Furthest Reasoning with Plan Assessment: Stable Reasoning Path with Retrieval-Augmented Large Language Models},
author = {Yin Zhu and Zhiling Luo and Gong Cheng},
journal= {arXiv preprint arXiv:2309.12767},
year = {2023}
}