用于隐藏混淆下CATE估计的分部初始化策略以缓解过拟合问题
机器学习
2025-01-28 v2
摘要
从观察数据估计条件平均处理效应(CATE)在电子商务、医疗和经济学等领域发挥着关键作用。现有研究主要依赖于不存在隐藏混淆的强 ignorability 假设,而这种假设无法从观察数据中进行测试,并且可能使任何因果结论失效。相比之下,来自随机对照试验(RCT)的数据不受混淆影响,但通常受限于小样本规模。为避免由小规模RCT数据引起的过拟合,我们提出一种新型两阶段预训练-微调(TSPF)框架,采用分部参数初始化策略以应对隐藏混淆下的CATE估计。在第一阶段,训练协变量的基础表示,以通过大规模观察数据估计反事实结果。在第二阶段,我们提出对协变量进行增强表示的训练,该增强表示与第一阶段获取的基础表示拼接,以纠正隐藏混淆。与从头训练单独网络不同,部分预测头从第一阶段初始化。我们在两个数据集上进行大量实验,验证了该方法的优越性。
引用
@article{arxiv.2501.08888,
title = {A Partial Initialization Strategy to Mitigate the Overfitting Problem in CATE Estimation with Hidden Confounding},
author = {Chuan Zhou and Yaxuan Li and Chunyuan Zheng and Haiteng Zhang and Haoxuan Li and Mingming Gong},
journal= {arXiv preprint arXiv:2501.08888},
year = {2025}
}
备注
Presented as a poster in the 2nd Workshop on Causal Inference and Machine Learning in Practice at KDD 2024