中文

通过渐进式混淜因子插值来缓解隐藏混淜

计算与语言 2025-07-08 v1 人工智能

摘要

隐藏混淜是从观察数据估计处理效应的核心挑战,因为不可观测变量可能导致偏差的因果估计。虽然最近的工作探索了使用大语言模型(LLM)进行因果推断,但大多数方法仍依赖于无混淜假设。本文首次尝试使用 LLM 来缓解隐藏混淜。我们提出 ProCI(渐进式混淜因子插值),一个框架,可激发 LLM 的语义和世界知识,迭代生成、插值和验证隐藏混淜因子。ProCI 利用 LLM 的两个关键能力:其强大的语义推理能力,使其能够从结构化和非结构化输入中发现合理的混淜因子;其内嵌的世界知识,支持在潜在混淜下的反事实推理。为提高鲁棒性,ProCI 采用分布式推理策略而非直接值插值,以防止输出坍缩。广泛的实验表明,ProCI 能发现有意义的混淜因子,并在各种数据集和 LLM 上显著改进处理效应估计。

引用

@article{arxiv.2507.02928,
  title  = {Mitigating Hidden Confounding by Progressive Confounder Imputation via Large Language Models},
  author = {Hao Yang and Haoxuan Li and Luyu Chen and Haoxiang Wang and Xu Chen and Mingming Gong},
  journal= {arXiv preprint arXiv:2507.02928},
  year   = {2025}
}