从高维数据中寻找重要基因:统计检验与机器学习方法的评估
机器学习
2012-05-31 v1 机器学习
定量方法
摘要
在过去的几十年里,统计学家和机器学习研究者开发了成千上万种新工具用于高维数据降维,以识别对特定性状最负责的变量。这些工具在众多场景中有应用,包括商业、教育、法医学和生物学(如微阵列、蛋白质组学、脑成像)等领域的数据分析。在本工作中,我们重点研究了某些工具在分析基准结肠癌数据(2000个变量;Alon等,1999)和前列腺癌数据(6033个变量;Efron,2010,2008)时的局限性和潜在误用。我们的分析表明,产生100%准确率的模型往往选择不同的基因集,并且无法经受参数估计和模型稳定性的检验。此外,我们创建了大量模拟数据集和“人工疾病”来评估常用统计和数据挖掘工具的可靠性。我们发现某些广泛使用的模型可以在不使用任何导致疾病的变量的情况下以100%的准确率对数据进行分类。在中等样本量和适当预筛选的条件下,随机梯度提升将被证明是从高维数据集中进行基因选择和变量筛选的优越模型。
引用
@article{arxiv.1205.6523,
title = {Finding Important Genes from High-Dimensional Data: An Appraisal of Statistical Tests and Machine-Learning Approaches},
author = {Chamont Wang and Jana Gevertz and Chaur-Chin Chen and Leonardo Auslender},
journal= {arXiv preprint arXiv:1205.6523},
year = {2012}
}
备注
36 pages, 9 figures