中文

基于校准对齐提高协变量不匹配情境下的 RCT 基于 CATE 估计

机器学习 2026-04-07 v2

摘要

随机对照试验(RCT)是估计异质处理效应的黄金标准,但常常缺乏足够的功效以检测效应差异。大规模观察性研究(OS)可用于补充 RCT 以进行条件平均处理效应(CATE)估计,但关键障碍是协变量不匹配:两种数据源测量不同的、仅部分重叠的协变量。我们提出 CALM(Calibrated ALignment under covariate Mismatch),通过学习嵌入将每个来源的特征映射到 common representation space,从而规避插值问题。OS 结果模型被传输到 RCT 嵌入空间并使用试验数据进行校准,保留了来自随机化的因果识别。有限样本风险界限分解为对齐误差、结果模型复杂度和校准复杂度三个术语,阐明了在何种情况下嵌入对齐优于插值。在校准基于的线性变体下,该框架可防止负迁移;神经网络变体在严重分布迁移下可能脆弱。在稀疏线性模型下,嵌入方法严格优于插值。51 种设置的仿真实验确认:(i) 校准方法在线性 CATE 上等价,(ii) 神经网络嵌入变体在 22 种非线性情形下以显著优势获胜。

关键词

引用

@article{arxiv.2603.19186,
  title  = {Improving RCT-Based CATE Estimation Under Covariate Mismatch via Calibrated Alignment},
  author = {Amir Asiaee and Samhita Pal},
  journal= {arXiv preprint arXiv:2603.19186},
  year   = {2026}
}