中文

CRAwDAD:基于双智能体辩论的因果推理增强

机器学习 2026-03-10 v2 多智能体系统

摘要

当人类推理因果关系时,他们通常会考虑许多 competing 的“假设情景”再决定哪种解释最合适。类比地,具备因果推理能力的先进语言模型可以考虑多种干预和反事实情景,以判断因果主张的有效性。关键在于,这种类型的推理不像单一计算那样,而更像是来自备选假设之间内部分辩。本文通过双智能体辩论框架将这种对话显式化,其中一个模型提供结构化的因果推理,另一个则批判性地检视此类推理是否存在逻辑缺陷。当出现分歧时,智能体试图说服彼此,挑战彼此的逻辑并修订其结论,直到他们在达成一致答案为止。为了利用这种 deliberative 过程,我们特别使用推理语言模型,其在因果推理和对抗性辩论方面的优势相对于标准大型语言模型仍有未被充分探索。我们在CLadder数据集上评估了该方法,该数据集将自然语言问题链接到形式化定义的因果图中,覆盖Pearl梯阶因果推理的三个层次。我们以Qwen3和DeepSeek-R1作为辩论智能体,证明多智能体辩论显著提升了DeepSeek-R1在因果推理中的总体准确率,从78.03%提升至87.45%,其中反事实类别从67.94%提升至80.04%。同样,Qwen3的总体准确率从84.16%提升至89.41%,反事实问题从71.53%提升至80.35%,显示即使是强大的模型仍然从与较弱模型的辩论中获益良多。我们的结果凸显了推理模型作为因果推理中多智能体系统构建块的潜力,并展示了在因果问题解决中多样化视角的重要性。

关键词

引用

@article{arxiv.2511.22854,
  title  = {CRAwDAD: Causal Reasoning Augmentation with Dual-Agent Debate},
  author = {Finn G. Vamosi and Nils D. Forkert},
  journal= {arXiv preprint arXiv:2511.22854},
  year   = {2026}
}

备注

12 pages, 8 figures. Code available at https://github.com/finnvamosi/CRAwDAD