通过群相对策略优化在结构因果模型中构建多跳推理
人工智能
2026-05-11 v2
摘要
多跳事实验证(MHFV)需要跨越不相关证据的复杂推理,这对大语言模型(LLM)构成了重大挑战,因而常出现幻觉和离散的逻辑链。现有方法虽通过链式思考(CoT)提升了透明度,但缺乏对证据与主张之间因果依赖关系的显式建模。本文提出一种新框架,将推理内置于结构因果模型(SCM)中,将验证过程建模为构造性因果推理。我们经验性地识别了推理链长度与准确率之间的“倒U形”相关性,揭示过度的结构复杂性会损害性能。为此,我们提出一种基于规则的强化学习策略,使用群相对策略优化(GRPO)动态优化结构深度与简洁性之间的权衡。广泛的实验在HoVer和EX-FEVER上表明,我们的SCM-GRPO框架显著优于最先进的基线,为复杂事实验证提供了一个可靠且可解释的解决方案。
引用
@article{arxiv.2605.01482,
title = {Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization},
author = {Yunhan Bu and Quan Zhang and Huaping Zhang and Guotong Geng and Chunxiao Gao and Askar Hamdulla and Juan Wang and Qiuchi Li and Baohua Zhang and Shuai Lei and Yunbo Cao and Zhunchen Luo},
journal= {arXiv preprint arXiv:2605.01482},
year = {2026}
}