中文

淘金:用于高维受控变量选择的模型-X仿制品方法

统计方法学 2017-12-13 v4 统计理论 应用统计 统计理论

摘要

许多当代大规模应用涉及构建可解释模型,以非线性方式将大量潜在协变量与响应变量联系起来,例如当响应变量为二值时。尽管该建模问题已被广泛研究,但如何有效控制错误发现的比例,即使在高维逻辑回归中,仍不清楚,更不用说一般的高维非线性模型。为解决这一实际问题,我们提出了一个新的modelmodel-XX knockoffs框架,它从不同的视角解读了最初为控制线性模型中错误发现率而设计的knockoff过程(Barber and Candès, 2015)。knockoff过程受限于npn\ge p的同方差线性模型,而此处的关键创新在于,模型-X knockoffs在响应变量的条件分布任意且完全未知的设置下,能从有限样本中提供有效推断。此外,无论协变量数量多少,这一点均成立。在如此广泛的设置中实现正确推断,是通过概率性地而非几何性地构造knockoff变量来完成的。为此,我们的方法要求协变量是随机的(独立同分布的行),且其分布已知,尽管我们提供了初步实验证据表明我们的过程对未知/估计的分布具有稳健性。据我们所知,没有其他过程能在如此普遍性下解决受控受控变量选择问题,但在存在竞争对手的受限设置中,我们通过模拟展示了knockoffs的优越功效。最后,我们将我们的过程应用于英国一项克罗恩病病例对照研究的数据,得出的发现数量是同一数据原始分析的两倍。

关键词

引用

@article{arxiv.1610.02351,
  title  = {Panning for Gold: Model-X Knockoffs for High-dimensional Controlled Variable Selection},
  author = {Emmanuel Candes and Yingying Fan and Lucas Janson and Jinchi Lv},
  journal= {arXiv preprint arXiv:1610.02351},
  year   = {2017}
}

备注

39 pages, 10 figures, 2 tables