中文

处理删失与高维性的结果自适应倾向得分方法:在保险理赔中的应用

统计方法学 2022-08-02 v1 应用统计

摘要

倾向得分常用于减少非随机观察研究中估计平均处理效应时的混杂偏倚。该方法的一个基本假设是,所有与处理及关注结果均相关的混杂因素均被测量并纳入倾向得分模型。在缺乏关于潜在混杂因素的强先验知识时,研究者可能不可知地希望调整一组高维的预处理变量。因此,倾向得分估计需要变量选择过程。此外,近期研究表明,在倾向得分模型中仅纳入与处理相关的变量可能夸大处理效应估计的方差,而纳入仅对结果有预测性的变量则可提高效率。本文中,我们提出一种灵活的方法,通过将预测的二值结果概率(OP)作为协变量纳入,从而将结果-协变量关系引入倾向得分模型。我们的方法可轻易适配于变量选择方法的集成,包括正则化方法以及基于分类与回归树的现代机器学习工具。我们评估了我们的方法在多个处理组中估计可能删失的二值结果的处理效应。模拟研究表明,纳入OP估计倾向得分可提高统计效率并防范模型误设。所提方法应用于从一个私人保险理赔数据库中识别的晚期前列腺癌患者队列,以比较四种常用治疗去势抵抗性前列腺癌药物的不良反应。

关键词

引用

@article{arxiv.2208.00114,
  title  = {Outcome Adaptive Propensity Score Methods for Handling Censoring and High-Dimensionality: Application to Insurance Claims},
  author = {Youfei Yu and Jiacong Du and Min Zhang and Zhenke Wu and Andrew M. Ryan and Bhramar Mukherjee},
  journal= {arXiv preprint arXiv:2208.00114},
  year   = {2022}
}

备注

22 pages, 6 figures, 2 tables