NoisyCausal:用于评估结构化噪声下的因果推理基准
计算与语言
2026-05-07 v1 人工智能
摘要
自然语言中的因果推理需要识别相关变量、理解它们的相互作用以及在常受噪声或歧义条件约束的情况下推理影响和干预。虽然大型语言模型(LLMs)表现出强大的通用推理能力,但它们在区分相关性与因果性方面仍存在困难,尤其是在观察部分错误或存在无关信息时。本文引入了 NoisyCausal,一个用于评估结构化噪声下因果推理的新基准。每个实例均从真实因果图生成,并通过注入可控形式的噪声(如无关干扰项、值扰动、混杂因素和部分可观测性)置于自然语言情境中。此外,我们提出了一种模块化推理框架,将 LLMs 与显式因果结构相结合,以应对这些挑战。该方法引导 LLMs 提取变量、从上下文构建因果图,然后将推理任务重新表述为以该图为基础的结构化提示。与仅依赖统计模式不同,LLMs 受到符号结构的指导,从而实现更具可解释性和鲁棒性的推理。实验结果表明,我们的方法在 NoisyCausal 上显著优于标准提示和推理基线。此外,它在无需任务特定微调的情况下能良好地泛化到外部基准(如 Cladder)。我们的发现凸显了将因果抽象与语言驱动推理相结合,以实现 LLMs 中可靠且忠实的因果理解的重要性。
引用
@article{arxiv.2605.04313,
title = {NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured Noise},
author = {Zhi Xu and Yun Fu},
journal= {arXiv preprint arXiv:2605.04313},
year = {2026}
}
备注
ACL oral accept; 5 figures, 8 tables