中文

基于 knockoffs 的稳健推断

统计方法学 2019-02-12 v4

摘要

我们考虑变量选择问题,该问题旨在从众多候选特征 X1,,XpX_1, \ldots, X_p 中识别影响响应 YY 的重要变量。我们希望在做到这一点的同时,就假阳性比例——即在已知其他特征后事实上对 YY 无影响却被选中的变量 XjX_j——提供有限样本保证。当特征数 pp 很大(甚至可能大于样本量 nn),且我们对 YYXX 之间的依赖类型毫无先验知识时,只要特征向量 X=(X1,,Xp)X=(X_1,\dots,X_p) 的分布被精确已知,model-X knockoffs 框架仍允许我们以有保障的错误发现率上界选择模型。该模型选择过程通过构造每个 pp 特征的“knockoff 副本”来操作,这些副本被用作对照组以确保模型选择算法不会选中过多无关特征。本工作中,我们研究特征 XX 的分布仅能被估计而非精确已知、因而 XjX_j 的 knockoff 副本构造存在一定偏差的实际设定。我们的结果完全不依赖任何建模假设,表明所得模型选择过程导致的错误发现率膨胀,与我们在估计每个特征 XjX_j 给定其余特征 {Xk:kj}\{X_k:k\neq j\} 的条件分布时的误差成正比。因此,model-X knockoff 框架对 XX 分布底层假设中的误差具有稳健性,使其成为许多实际应用(如全基因组关联研究,其中特征 X1,,XpX_1,\dots,X_p 的底层分布被准确估计但非精确已知)的有效方法。

关键词

引用

@article{arxiv.1801.03896,
  title  = {Robust inference with knockoffs},
  author = {Rina Foygel Barber and Emmanuel J. Candès and Richard J. Samworth},
  journal= {arXiv preprint arXiv:1801.03896},
  year   = {2019}
}