中文

基于自批判引导的多跳问答迭代推理

计算与语言 2025-05-27 v1

摘要

虽然大型语言模型(LLM)在推理能力方面表现突出,但在知识密集型多跳推理任务中仍面临挑战。近期研究探索了迭代检索以解决复杂问题的方法,但缺乏中间引导常导致检索不准确和中间推理错误,从而产生错误的推理结果。为此,我们提出了自批判引导迭代推理方法(Self-Critique Guided Iterative Reasoning, SiGIR),通过自批判反馈引导迭代推理过程。具体而言,通过端到端训练,使模型能够通过问题分解逐步解决复杂问题。此外,模型能够对其中间推理步骤进行自评估。在迭代推理期间,模型进行分支探索,并利用自评估引导选择有前景的推理轨迹。在三个多跳推理数据集上的大量实验表明,我们所提方法的有效性,其性能比之前的 SOTA 提升了 8.6%8.6\%。此外,我们的深入分析为未来研究提供了见解。我们的代码、数据和模型均已在 Github 上提供:https://github.com/zchuz/SiGIR-MHQA。

关键词

引用

@article{arxiv.2505.19112,
  title  = {Self-Critique Guided Iterative Reasoning for Multi-hop Question Answering},
  author = {Zheng Chu and Huiming Fan and Jingchang Chen and Qianyu Wang and Mingda Yang and Jiafeng Liang and Zhongjie Wang and Hao Li and Guo Tang and Ming Liu and Bing Qin},
  journal= {arXiv preprint arXiv:2505.19112},
  year   = {2025}
}

备注

ACL 2025 Findings