通过符号验证揭示LLM因果推理中的隐藏正确性
人工智能
2026-01-30 v1
摘要
大型语言模型(LLM)越来越多地被应用于涉及因果推理的任务。然而,当前的基准测试通常依赖于字符串匹配或表面层次的度量,这些度量无法捕捉模型的输出在因果推理语义下是否形式上有效。为了解决这个问题,我们提出了DoVerifier,一个简单的符号验证器,它使用do-演算和概率论的规则,检查LLM生成的因果表达式是否可以从给定的因果图中推导出来。这使我们能够恢复对因果查询的正确回答,而这些回答原本会因其因果语义的表面差异而被标记为错误。我们在合成数据和因果问答基准上的评估表明,DoVerifier更准确地捕捉了因果推理轨迹的语义正确性,为评估LLM在因果推理上的表现提供了一种更严格且信息更丰富的方法。
引用
@article{arxiv.2601.21210,
title = {Uncovering Hidden Correctness in LLM Causal Reasoning via Symbolic Verification},
author = {Paul He and Yinya Huang and Mrinmaya Sachan and Zhijing Jin},
journal= {arXiv preprint arXiv:2601.21210},
year = {2026}
}
备注
EACL 2026 Main