面向海量数据的 Knockoffs:具有错误发现保证的新特征重要性统计量
机器学习
2019-05-30 v2 机器学习
摘要
机器学习和统计学中的一个重要问题是识别因果影响结果的特征。仅从纯观测数据通常不可能做到这一点,一个自然的放宽是对所有其他观测特征条件化后仍与结果相关的特征。例如,我们想确定吸烟在条件于人口统计后确实与癌症相关。knockoff 过程是统计学中最近的突破,理论上可以识别真正相关的特征,同时保证错误发现的限制。其思想是创建捕获特征间相关性的合成数据——knockoffs。然而,生成和使用 knockoffs 存在显著的计算和实际挑战。本文做出了若干关键进展,使 knockoff 应用更高效和更强有力。我们开发了从贝叶斯网络生成有效 knockoffs 的高效算法。然后我们系统评估 knockoff 检验统计量并开发了具有改进功效的新统计量。本文结合了新数学保证与在真实和合成数据上的系统实验。
引用
@article{arxiv.1807.06214,
title = {Knockoffs for the mass: new feature importance statistics with false discovery guarantees},
author = {Jaime Roquero Gimenez and Amirata Ghorbani and James Zou},
journal= {arXiv preprint arXiv:1807.06214},
year = {2019}
}
备注
Accepted at AISTATS 2019