中文

Floodgate:无模型变量重要性的推断方法

统计方法学 2022-09-13 v5

摘要

许多现代应用试图在存在(可能高维的)混杂变量 ZZ 的情况下,理解结果变量 YY 与协变量 XX 之间的关系。尽管已有大量关注用于检验在给定 ZZ 的条件下 YY 是否依赖于 XX,本文旨在超越检验,进一步推断这种依赖的强度。我们首先定义了估计目标——最小均方误差 (mMSE) 差距,它以确定性、无模型、可解释且对非线性和交互作用敏感的方式量化了 YYXX 之间的条件关系。随后,我们提出了一种名为 floodgate 的新推断方法,该方法可利用用户选择的任何工作回归函数(例如,允许其由最先进的机器学习算法拟合或源自定性领域知识)来构建渐近置信界,并将其应用于 mMSE 差距。我们还证明了 floodgate 的准确性(从置信界到估计目标的距离)能自适应于工作回归函数的误差。接着,我们展示了当 YY 为二值变量时,可将相同的 floodgate 原理应用于不同的变量重要性度量。最后,我们通过一系列模拟展示了 floodgate 的性能,并将其应用于英国生物银行的数据,以推断血小板计数对各种遗传突变组的依赖强度。

关键词

引用

@article{arxiv.2007.01283,
  title  = {Floodgate: inference for model-free variable importance},
  author = {Lu Zhang and Lucas Janson},
  journal= {arXiv preprint arXiv:2007.01283},
  year   = {2022}
}