通过掩蔽似然比的渐近最优Knockoff统计量
统计方法学
2024-10-02 v2
摘要
在特征选择问题中,knockoffs(模仿变量)是原始特征的合成对照。使用knockoffs可使分析人员近乎任意地选用变量重要性度量或“特征统计量”来选择特征,同时严格控误发现。然而,尚不清楚何种统计量能最大化功效。在本文中,我们认为最先进的基于lasso的特征统计量常优先选择不太可能被发现的特征,导致实际应用中的低功效。相反,我们引入掩蔽似然比(MLR)统计量,其根据区分各特征与其knockoff的能力来优先排序特征。尽管没有单一特征统计量在所有情形下一致最强大,我们证明MLR统计量在用户指定的数据贝叶斯模型下渐近最大化发现数量。(与所有特征统计量一样,MLR统计量始终提供频率主义误差控制。)该结果对问题维度无限制且不做参数假设;相反,我们需要一个仅依赖于已知量的“局部依赖”条件。在模拟与三个真实应用中,MLR统计量优于最先进的特征统计量,包括在贝叶斯模型设定错误的情况下。我们在python包knockpy中实现了MLR统计量;我们的实现通常比计算交叉验证lasso更快。
引用
@article{arxiv.2212.08766,
title = {Asymptotically Optimal Knockoff Statistics via the Masked Likelihood Ratio},
author = {Asher Spector and William Fithian},
journal= {arXiv preprint arXiv:2212.08766},
year = {2024}
}
备注
68 pages, 21 figures; clearer notation throughout