中文

推理法庭:结合推理、行动与判断实现多跳推理

计算与语言 2025-04-15 v1 人工智能

摘要

虽然大语言模型(LLM)在问答和事实核查等任务中展现出强大的能力,但在需要整合多个信息来源的多跳任务中仍然 suffer from 幻觉和推理错误。当前方法通过检索技术(将推理锚定在外部证据)、基于推理的方法(通过改进提示提升连贯性)或两者结合的混合策略来解决这些问题。其中一种突出的混合方法 ReAct 在纯检索或纯推理方法上表现优异;然而,它缺乏对中间推理步骤的内部验证,允许潜在错误在复杂推理任务中传播。本文我们引入推理法庭(Reasoning Court, RC),一种新型框架,将迭代推理与检索方法(如 ReAct)扩展,加入专门的 LLM 评判器。不同于 ReAct,RC 采用该评判器独立评估多个候选答案及其关联推理,由独立的 LLM 代理生成。评判器被要求根据所呈现推理和证据,挑选最具事实依据性和逻辑连贯性的答案,或若所有候选答案都不充分、有缺陷或无效,基于可用证据和其预训练知识综合新答案。在多跳基准(HotpotQA、MuSiQue)和事实核查(FEVER)上的评估表明,RC 在无需任务特定微调的情况下,持续优于最先进的 few-shot 提示方法。

关键词

引用

@article{arxiv.2504.09781,
  title  = {Reasoning Court: Combining Reasoning, Action, and Judgment for Multi-Hop Reasoning},
  author = {Jingtian Wu and Claire Cardie},
  journal= {arXiv preprint arXiv:2504.09781},
  year   = {2025}
}