中文

我们能进一步引导 LLM 推理吗?基于批判性思考的规划与检索增强解决具有挑战性任务

计算与语言 2024-10-03 v1

摘要

最先进的大型语言模型 (LLM) 在问题解决方面表现突出,但在复杂推理和事实正确性方面可能存在挑战。现有方法利用链律思考和检索增强生成 (RAG) 的优势,将复杂问题分解为更简单的步骤并应用检索以提高事实正确性。这些方法在直观推理任务上表现良好,但在竞赛编程和数学等具有挑战性的任务上常常难以做到,原因是频繁的推理错误和无关知识检索。为此,我们引入一种新型框架,即批判性思考引导的规划与检索增强 (CR-Planner),以细化的批判性思考模型指导推理和检索过程。CR-Planner 通过迭代选择和执行子目标来解决问题。首先,它从推理、查询生成和检索中识别最有前景的子目标,由批判性思考模型(称为子目标批判模型)给出奖励进行指导。随后,它通过抽样和由另一批判模型(称为执行批判模型)进行评估来执行该子目标。该迭代过程基于检索信息和批判模型,使 CR-Planner 能够有效地导航解空间以达到最终答案。我们采用蒙特卡洛树搜索收集训练批判模型的数据,使其能够系统地探索动作序列及其长期影响。我们在具有挑战性的领域知识密集型和推理密集型任务上验证了 CR-Planner,包括竞赛编程、定理驱动的数学推理和复杂领域检索问题。我们的实验表明,CR-Planner 在基线方法上显著优于后者,凸显其在提升推理和检索方面解决具有挑战性问题中的有效性。

关键词

引用

@article{arxiv.2410.01428,
  title  = {Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks},
  author = {Xingxuan Li and Weiwen Xu and Ruochen Zhao and Fangkai Jiao and Shafiq Joty and Lidong Bing},
  journal= {arXiv preprint arXiv:2410.01428},
  year   = {2024}
}

备注

Work in progress