相关性下的基因排序与生物标志物发现
应用统计
2009-10-09 v3
摘要
生物标志物发现和基因排序是基因组高通量分析中的标准任务。通常,标志物的排序基于t分数的稳定变体,如调节t或SAM统计量。然而,这些程序忽略了基因-基因相关性,这可能对基因排序和后续检验的效能产生深远影响。我们提出一个简单的程序,调整基因层面的t统计量以考虑基因间的相关性。由此产生的相关性调整t分数(“cat”分数)是从预测角度推导的,即作为两类线性判别分析中区分组别的变量选择分数。在没有相关性的情况下,cat分数退化为标准t分数。此外,使用cat分数可以轻松评估特征组(即基因集)。为了从小样本数据计算cat分数,我们提出了一种收缩程序。在一项包含六种不同合成和经验相关结构的比较研究中,我们表明cat分数改善了基因排序的估计,并在固定真实发现率的情况下导致更高的效能,反之亦然。最后,我们还通过分析代谢组学数据来说明cat分数。收缩cat分数已在R包“st”中实现,可从URL http://cran.r-project.org/web/packages/st/ 获取。
引用
@article{arxiv.0902.0751,
title = {Gene ranking and biomarker discovery under correlation},
author = {Verena Zuber and Korbinian Strimmer},
journal= {arXiv preprint arXiv:0902.0751},
year = {2009}
}
备注
18 pages, 5 figures, 1 table