基于核岭回归的CATE迁移学习
统计方法学
2025-05-15 v3 机器学习
机器学习
摘要
数据的激增激发了利用一项研究的发现来估计不同目标总体中处理效应的显著兴趣,而无需直接观测结果。然而,迁移学习过程经常受到严重的协变量偏移以及(i)源总体与目标总体之间和(ii)源总体中处理组与对照组之间重叠有限的阻碍。我们提出了一种基于核岭回归(KRR)的重叠自适应条件平均处理效应(CATE)迁移学习新方法。我们的方法将带标签的源数据划分为两个子集。第一个子集用于基于回归调整和伪结果训练候选CATE模型。然后利用第二个子集和未标记的目标数据,通过另一种基于伪结果的策略选择最优模型。我们通过紧非渐近MSE界为方法提供了理论依据,突出了其对弱重叠和CATE函数复杂性的适应性。广泛的数值实验证实了我们方法在有限样本效率和适应性方面的优越性。最后,我们通过在一个401(k)资格数据集上的演示来验证我们方法的有效性。
引用
@article{arxiv.2502.11331,
title = {Transfer Learning of CATE with Kernel Ridge Regression},
author = {Seok-Jin Kim and Hongjie Liu and Molei Liu and Kaizheng Wang},
journal= {arXiv preprint arXiv:2502.11331},
year = {2025}
}