用于聚类纵向基因表达数据的 Dirichlet 过程混合模型
统计方法学
2016-09-27 v2
摘要
亚组识别(聚类)是生物医学研究中的一个重要问题。基因表达谱通常被用于定义亚组。与仅通过基线谱捕获的信息相比,纵向基因表达谱可能提供关于疾病进展的额外信息。此外,纵向基因表达数据允许在对患者进行分组时考虑个体内变异性。因此,借助纵向基因表达数据,亚组识别可能更加准确和有效。然而,现有的统计方法无法充分利用这些数据进行患者聚类。在本文中,我们在贝叶斯框架下引入了一种基于纵向基因表达谱的新的亚组识别方法。该方法称为 BClustLonG,采用线性混合效应框架对基因随时间的轨迹进行建模,同时基于从所有基因获得的回归系数联合进行聚类。为了考虑基因之间的相关性并缓解高维挑战,我们对回归系数采用因子分析模型。回归系数的均值利用 Dirichlet 过程先验分布以诱导聚类。通过广泛的模拟研究,我们表明 BClustLonG 的性能优于其他聚类方法。当应用于严重受伤(烧伤或创伤)患者数据集时,我们的模型能够区分烧伤患者与创伤患者,并识别出创伤患者中感兴趣的亚组。
引用
@article{arxiv.1609.02980,
title = {A Dirichlet Process Mixture Model for Clustering Longitudinal Gene Expression Data},
author = {Jiehuan Sun and Jose D. Herazo-Maya and Naftali Kaminski and Hongyu Zhao and Joshua L. Warren},
journal= {arXiv preprint arXiv:1609.02980},
year = {2016}
}
备注
This paper has been withdrawn by the author because it was submitted without consents of all authors