CauScientist:教导 LLM 尊重数据以实现因果发现
计算与语言
2026-01-21 v1 人工智能
机器学习
摘要
因果发现对于科学理解和可靠决策至关重要。现有方法面临关键局限性:纯数据驱动方法受到统计不可区分性和建模假设的困扰,而近期基于 LLM 的方法要么忽略统计证据,要么纳入可能误导结果的未经验证的先验。为此,我们提出 CauScientist,这是一个协同框架,将作为生成假设的“数据科学家”的 LLM 与作为严谨“验证者”的概率统计相结合。CauScientist 采用混合初始化来选择优越的起始图,通过由统计标准验证的 LLM 提议的修改来迭代地细化结构,并维护错误记忆以指导高效的搜索空间。实验表明,CauScientist 大大优于纯数据驱动的基线,实现了高达 53.8% 的 F1 分数提升,并将召回率从 35.0% 提高到 100.0%。值得注意的是,尽管独立 LLM 的性能会随图复杂度增加而下降,但在 37 节点图上,CauScientist 与 Qwen3-32B 相比将结构汉明距离(SHD)降低了 44.0%。我们的项目页面位于 https://github.com/OpenCausaLab/CauScientist。
引用
@article{arxiv.2601.13614,
title = {CauScientist: Teaching LLMs to Respect Data for Causal Discovery},
author = {Bo Peng and Sirui Chen and Lei Xu and Chaochao Lu},
journal= {arXiv preprint arXiv:2601.13614},
year = {2026}
}