论具有相关单元的因果机器学习中交叉拟合的使用
统计方法学
2026-05-12 v2
摘要
在因果机器学习中,干扰模型的拟合与评估通常在观测数据的独立分区或折上进行。这种称为交叉拟合的技术消除了使用黑箱预测算法引入的偏差。当研究单元可能相关时,例如空间、聚类或时间序列数据,研究者常设计特定形式的交叉拟合以最小化折间相关性。我们证明,或许与普遍看法相反,这通常是不必要的:即使单元间可能存在相关性,按研究单元独立进行交叉拟合仍能消除关键偏差项。在具有多种相关结构的模拟实验中,我们表明,与力求消除折间相关性的技术相比,忽略相关性的交叉拟合使因果机器学习估计量实现了相同或更优的偏差与精度。
引用
@article{arxiv.2601.10899,
title = {On the use of cross-fitting in causal machine learning with correlated units},
author = {Salvador V. Balkus and Hasan Laith and Nima S. Hejazi},
journal= {arXiv preprint arXiv:2601.10899},
year = {2026}
}
备注
14 pages, 8 figures