中文

面向政策相关观察性研究中匹配的协变量重要性学习

机器学习 2025-09-01 v2 机器学习 统计方法学

摘要

匹配方法被广泛用于减少观察性研究中的混杂效应,但传统方法通常将所有协变量视为同等重要,当协变量与研究的相关性不同时,这可能导致性能不佳。我们提出优先级感知一对一匹配算法(PAMA),这是一种新颖的半监督框架,它从专家配对的部分单元数据中学习协变量重要性度量,并用其为额外单元进行匹配。该算法优化一个加权二次得分,该得分反映了每个协变量与研究之间的相关性,并利用未标记数据迭代更新得分函数中的协变量重要性度量。PAMA 不依赖模型,但我们已证明,当理想的匹配规则与设计一致时,协变量重要性度量——即学习到的权重——具有一致性。此外,我们引入了处理不平衡数据、适应时间协变量以及提高对误配观测稳健性的扩展方法。在模拟中,PAMA 优于标准方法,尤其是在高维设置和模型设定错误的情况下。应用于一项关于线下教学与COVID-19传播的真实世界研究,PAMA 使用基线协变量恢复的专家指定匹配数量几乎是竞争方法的两倍。一个自学习扩展在模拟中提升了性能,尽管其收益依赖于具体情境。据我们所知,PAMA 是首个将半监督学习应用于协变量重要性不等的观察性匹配的框架。它为将专家见解纳入政策相关的观察性研究提供了一个可扩展且可解释的工具。

关键词

引用

@article{arxiv.2403.12367,
  title  = {Learning covariate importance for matching in policy-relevant observational research},
  author = {Hongzhe Zhang and Jiasheng Shi and Jing Huang},
  journal= {arXiv preprint arXiv:2403.12367},
  year   = {2025}
}