面向高维组学数据的结果引导疾病亚型划分
统计方法学
2020-07-23 v1 应用统计
摘要
高通量微阵列与测序技术已被用于识别仅凭临床变量无法观察到的疾病亚型。经典的无监督聚类策略主要关注识别在基因特征上具有相似模式的子群体。然而,由于对应于无关混杂因素(如性别或年龄)的特征可能主导聚类过程,所得簇未必能捕捉具有临床意义的疾病亚型。这引发了一个基本问题:我们能否找到一种由预先指定的疾病结果引导的亚型划分流程?现有方法(如监督聚类)采用两阶段方案,并依赖于与结果相关的任意数量选定特征。本文提出一种统一的潜生成模型,用于执行基于组学数据构建的结果引导疾病亚型划分,从而改进所关注疾病对应的亚型结果。特征选择被嵌入于正则化回归中。我们采用改进的 EM 算法进行数值计算与参数估计。所提方法同时执行特征选择、潜亚型刻画与结果预测。为应对可能的离群值或混合高斯假设的违背,我们引入使用自适应 Huber 或中位数截断损失函数的鲁棒估计。大量模拟以及一项结合转录组与临床数据的复杂肺病应用,证明了所提方法识别适用于精准医学探索的临床相关疾病亚型与标志基因的能力。
引用
@article{arxiv.2007.11123,
title = {Outcome-Guided Disease Subtyping for High-Dimensional Omics Data},
author = {Peng Liu and Yusi Fang and Zhao Ren and Lu Tang and George C. Tseng},
journal= {arXiv preprint arXiv:2007.11123},
year = {2020}
}
备注
29 pages in total, 4 figures, 2 tables and 1 supplement