深度直接似然 Knockoffs
机器学习
2020-08-03 v1 机器学习
统计方法学
摘要
预测建模常使用深度神经网络等黑盒机器学习方法以达到最先进的性能。在科学领域中,科学家往往希望发现哪些特征对做出预测实际上是重要的。这些发现可能导致代价高昂的后续实验,因此重要的是发现的错误率不能太高。Model-X knockoffs 能够在控制 FDR 的前提下发现重要特征。然而,knockoffs 需要丰富的生成模型,能够准确建模 knockoff 特征,同时确保它们服从所谓的“交换(swap)”性质。我们提出了深度直接似然 Knockoffs (DDLK),它直接最小化由 knockoff 交换性质所隐含的 KL 散度。DDLK 包含两个阶段:首先最大化特征的显式似然,然后最小化特征与 knockoffs 的联合分布及它们之间任意交换后的分布之间的 KL 散度。为确保生成的 knockoffs 在任意可能的交换下均有效,DDLK 使用 Gumbel-Softmax 技巧在最坏情况交换下优化 knockoff 生成器。我们发现,在包括涉及来自 COVID-19 其中一个重灾区的大型数据集的任务在内的多种合成与真实基准上,DDLK 在控制错误发现率的同时比基线具有更高的功效。
引用
@article{arxiv.2007.15835,
title = {Deep Direct Likelihood Knockoffs},
author = {Mukund Sudarshan and Wesley Tansey and Rajesh Ranganath},
journal= {arXiv preprint arXiv:2007.15835},
year = {2020}
}