基于Rasch模型的高维数据降维与分类预测及其在微阵列基因表达数据中的应用
人工智能
2018-04-03 v1 应用统计
统计方法学
机器学习
摘要
分类预测是微阵列基因表达数据分析的重要应用。微阵列数据的高维性——即基因(变量)数量远大于样本(观测)数量——使得许多预测技术(如逻辑回归、判别分析)的应用变得困难。解决该问题的一个有效途径是采用降维统计技术。Rasch模型(RM)越来越多地用于心理学相关应用,为处理高维微阵列数据提供了一个有吸引力的框架。本文研究了基于RM的建模在二值化微阵列基因表达数据降维中的潜力,并在线性判别分析的分类预测背景下考察了其预测精度。我们使用两个不同的公开微阵列数据集来阐述该方法的通用框架。通过以主成分分析(PCA)为基准方法的重随机化方案评估所提方法的性能。结果表明,基于RM的降维与基于PCA的降维同样有效。该方法具有通用性,可应用于其他高维数据问题。
引用
@article{arxiv.1006.1030,
title = {Rasch-based high-dimensionality data reduction and class prediction with applications to microarray gene expression data},
author = {Andrej Kastrin and Borut Peterlin},
journal= {arXiv preprint arXiv:1006.1030},
year = {2018}
}