中文

通过稳健传播与可靠的 LLM 先验信息改进约束式因果发现

机器学习 2025-09-30 v1

摘要

从观察数据学习因果结构是科学建模与决策中至关重要的任务。约束式方法旨在恢复因果有向无环图(DAG)中的条件独立(CI)关系。经典方法如 PC 及其后续方法首先假设完美的 CI 测试和穷举搜索分离子集,先确定 v 结构边的方向,再从这些种子点传播边方向——这些假设在实际中常被违反,导致最终图谱中级联错误。近期研究探索使用大语言模型(LLM)作为专家,为边方向挑选节点,可能在假设不成立时增强边方向判断。然而,这类方法隐含假设专家完美,而 LLM 易产生幻觉。我们提出 MosaCD 方法,通过 CI 测试与 LLM 标注共同构建的高置信种子集合传播边,引入利用 LLM 位置偏差的随机查询,以过滤幻觉,仅保留高置信种子。随后采用新颖的置信度递减传播策略,优先确定最可靠的边,可与任何基于骨架的发现方法集成。在多个真实图谱上,MosaCD 在最终图构建中准确率显著高于现有约束式方法,主要得益于初始种子可靠性提升和稳健的传播策略。

关键词

引用

@article{arxiv.2509.23570,
  title  = {Improving constraint-based discovery with robust propagation and reliable LLM priors},
  author = {Ruiqi Lyu and Alistair Turcan and Martin Jinye Zhang and Bryan Wilder},
  journal= {arXiv preprint arXiv:2509.23570},
  year   = {2025}
}