聚类高维混合数据以揭示亚表型:表型与基因型数据的联合分析
应用统计
2018-05-25 v2
摘要
LIPGENE-SU.VI.MAX 研究与许多其他研究一样,记录了高维连续型表型数据和分类型基因型数据。LIPGENE-SU.VI.MAX 关注在研究代谢综合征时同时考虑表型和遗传因素的必要性,代谢综合征是一种可导致 2 型糖尿病和心血管疾病风险升高的复杂疾病。研究兴趣在于通过联合考虑表型和基因型数据,将 LIPGENE-SU.VI.MAX 参与者聚类为同质组或亚表型,并确定哪些变量具有区分度。我们开发了一种能够优雅适应高维混合数据的新型潜变量模型,利用贝叶斯有限混合模型对 LIPGENE-SU.VI.MAX 参与者进行聚类。该模型引入了计算高效的变量选择算法,通过 Gibbs 采样算法进行估计,并开发了近似的 BIC-MCMC 准则以选择最优模型。研究揭示了两个聚类或亚表型(“健康”和“高危”)。一小部分变量被判定为具有区分度,其中显著包含表型和基因型变量,凸显了同时考虑这两种因素的必要性。此外,在 LIPGENE-SU.VI.MAX 数据收集七年后,参与者接受了进一步分析以诊断是否患有代谢综合征。揭示出的两种亚表型与七年随访的疾病分类高度吻合,突显了表型和基因型因素在代谢综合征中的作用,并强调了该聚类方法在早期筛查中的潜在效用。此外,所提方法在参与者层面定义亚表型成员归属不确定性的能力,与精准医学和精准营养学的概念相契合。
引用
@article{arxiv.1606.05107,
title = {Clustering high dimensional mixed data to uncover sub-phenotypes:joint analysis of phenotypic and genotypic data},
author = {Damien McParland and Catherine M. Phillips and Lorraine Brennan and Helen M. Roche and Isobel Claire Gormley},
journal= {arXiv preprint arXiv:1606.05107},
year = {2018}
}
备注
36 pages, 5 figures and 4 tables