对基于网络和通路分类器用于乳腺癌预后预测的批判性评估
机器学习
2013-10-15 v2 定量方法
摘要
最近,一些结合原发肿瘤数据(如基因表达数据)和次级数据源(如蛋白质-蛋白质相互作用网络)的分类器被提出用于预测乳腺癌预后。在这些方法中,新的复合特征通常通过聚合多个基因的表达水平来构建。次级数据源被用来指导这种聚合。尽管许多研究声称这些方法相比单基因分类器提高了分类性能,但性能的提升难以评估。这主要源于不同乳腺癌数据集和验证程序被用来评估性能。在此,我们通过采用一个包含六个乳腺癌数据集的大型队列作为基准集,并对不同方法的分类准确率进行无偏评估来解决这些问题。与先前声称相反,我们发现复合特征分类器并不优于简单的单基因分类器。我们研究了以下因素对复合特征和单基因分类器性能的影响:(1) 所选特征的数量;(2) 选择特征所用的特定基因集;(3) 训练集的大小;(4) 数据集的异质性。引人注目的是,我们发现对次级数据源进行随机化(这破坏了这些数据源中的所有生物学信息)并不会导致复合特征分类器性能的下降。最后,我们表明,当对基因集大小进行适当校正时,单基因集的稳定性与复合特征集的稳定性相似。基于这些结果,目前没有理由在预测乳腺癌预后方面偏好基于复合特征的预后分类器而非单基因分类器。
引用
@article{arxiv.1110.3717,
title = {A critical evaluation of network and pathway based classifiers for outcome prediction in breast cancer},
author = {C. Staiger and S. Cadot and R. Kooter and M. Dittrich and T. Mueller and G. W. Klau and L. F. A. Wessels},
journal= {arXiv preprint arXiv:1110.3717},
year = {2013}
}