判别微阵列数据分析需要多少个基因?
生物物理
2007-05-23 v1 数据分析、统计与概率
定量方法
摘要
对来自 Whitehead/MIT 组的白血病数据的分析是一种判别分析(也称为监督学习)。在数千个被测表达水平的基因中,并非全部都可用于判别分析:一个基因可能既不有助于两类组织/癌症的分离,也可能因与其他基因高度相关而冗余。变量选择(本例中为基因选择)可在两个理论框架中处理。其一是模型选择,其二是模型平均。我们使用 Akaike 信息准则和贝叶斯信息准则结合 logistic 回归(判别、预测或分类)进行了模型选择,以确定提供最佳模型的基因数。这些模型选择准则对该含 38 个样本的数据集设定了 22-25 和 12-13 个基因的上限,且最佳模型仅由一个(编号4847,zyxin)或两个基因组成。我们还使用三种不同权重:最大似然、训练集上的预测率以及相等权重,对最佳单基因 logistic 预测子进行了模型平均。我们观察到这些加权预测子在测试集上的表现随纳入更多基因而逐渐下降,但未发现明显区分好与坏预测表现的截断点。
引用
@article{arxiv.physics/0104029,
title = {How Many Genes Are Needed for a Discriminant Microarray Data Analysis ?},
author = {Wentian Li and Yaning Yang},
journal= {arXiv preprint arXiv:physics/0104029},
year = {2007}
}
备注
8 pages, 4 figures, submitted to Proceedings of Critical Assessment of Microarray Data Analysis (CAMDA'00)