中文

多元连续与离散纵向数据的聚类分析

应用统计 2013-04-17 v1

摘要

在纵向研究及常规临床随访中,通常会收集受试者的多种结果变量,包括连续型和离散型数据。为激发本研究,我们考虑一项关于原发性胆汁性肝硬化 (PBC) 患者的纵向研究,其中以连续型的胆红素水平、离散型的血小板计数以及二分类的血管畸形指标作为此类纵向结果的示例。一个明显的需求是利用所有结果值将受试者分类为若干组(例如,在临床环境中具有相似预后的受试者组)。近年来,人们提出了许多基于纵向(或其他相关)结果进行分类的方法,其目标不仅涵盖生物统计学等传统领域,还包括快速发展的生物信息学等众多领域。然而,大多数现有方法仅将连续型结果作为分类基础,或者即使考虑了非连续型结果,也未将其与其他不同性质的结果结合使用。在此,我们提出一种统计方法,用于基于多种不同性质的纵向结果的重复测量,将受试者聚类(分类)为预设数量的组,这些组的先验特征未知。该方法依赖于经典广义线性混合模型 (generalized linear mixed model) 的多元扩展,并额外假设随机效应服从混合分布。我们基于模型的贝叶斯规范和基于模拟的马尔可夫链蒙特卡洛 (Markov chain Monte Carlo) 方法进行推断。为了在实践中应用该方法,我们准备了可在 R (http://www.R-project.org) 中使用的即用型软件。我们还讨论了分类中不确定性的评估,并探讨了使用最近提出的一种基于惩罚后验偏差(由 Plummer [Biostatistics 9 (2008) 523-539] 提出)的模型比较方法,在本例中用于选择聚类数量。

关键词

引用

@article{arxiv.1304.4448,
  title  = {Clustering for multivariate continuous and discrete longitudinal data},
  author = {Arnošt Komárek and Lenka Komárková},
  journal= {arXiv preprint arXiv:1304.4448},
  year   = {2013}
}

备注

Published in at http://dx.doi.org/10.1214/12-AOAS580 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)