基于 knockoffs 的稳健推断
统计方法学
2019-02-12 v4
摘要
我们考虑变量选择问题,该问题旨在从众多候选特征 中识别影响响应 的重要变量。我们希望在做到这一点的同时,就假阳性比例——即在已知其他特征后事实上对 无影响却被选中的变量 ——提供有限样本保证。当特征数 很大(甚至可能大于样本量 ),且我们对 与 之间的依赖类型毫无先验知识时,只要特征向量 的分布被精确已知,model-X knockoffs 框架仍允许我们以有保障的错误发现率上界选择模型。该模型选择过程通过构造每个 特征的“knockoff 副本”来操作,这些副本被用作对照组以确保模型选择算法不会选中过多无关特征。本工作中,我们研究特征 的分布仅能被估计而非精确已知、因而 的 knockoff 副本构造存在一定偏差的实际设定。我们的结果完全不依赖任何建模假设,表明所得模型选择过程导致的错误发现率膨胀,与我们在估计每个特征 给定其余特征 的条件分布时的误差成正比。因此,model-X knockoff 框架对 分布底层假设中的误差具有稳健性,使其成为许多实际应用(如全基因组关联研究,其中特征 的底层分布被准确估计但非精确已知)的有效方法。
引用
@article{arxiv.1801.03896,
title = {Robust inference with knockoffs},
author = {Rina Foygel Barber and Emmanuel J. Candès and Richard J. Samworth},
journal= {arXiv preprint arXiv:1801.03896},
year = {2019}
}