中文

RANK:基于图形非线性Knockoffs的大规模推断

统计理论 2017-09-04 v1 统计方法学 机器学习 统计理论

摘要

在当代具有一般高维非线性模型的大数据应用中,检验功效和可重复性是实现精细科学发现的关键。本文为Candès, Fan, Janson和Lv (2016)近期在高维背景下引入的无模型knockoffs程序提供了关于功效和稳健性的理论基础,其中协变量分布由高斯图模型刻画。我们证明,在温和的正则性条件下,高维线性模型中已知协变量分布的oracle knockoffs程序的功效随着样本量趋于无穷而渐近为1。当偏离理想情况时,我们提出了改进的无模型knockoffs方法,称为图形非线性knockoffs (RANK),以适应未知的协变量分布。我们通过证明错误发现率(FDR)在目标水平上渐近受控,且在使用估计的协变量分布时功效渐近为1,为改进程序的稳健性提供了理论论证。据我们所知,这是关于knockoffs程序功效的首个正式理论结果。模拟结果表明,与现有方法相比,我们的方法在FDR控制和功效方面均具有竞争力。我们分析了一个真实数据集,以进一步评估所建议的knockoffs程序的性能。

关键词

引用

@article{arxiv.1709.00092,
  title  = {RANK: Large-Scale Inference with Graphical Nonlinear Knockoffs},
  author = {Yingying Fan and Emre Demirkaya and Gaorong Li and Jinchi Lv},
  journal= {arXiv preprint arXiv:1709.00092},
  year   = {2017}
}

备注

37 pages, 6 tables, 9 pages supplementary material