一种多组学癌症数据整合分析的聚类方法
统计方法学
2022-02-11 v1 应用统计
摘要
快速的技术进步使得能够从单个样本中进行跨多个组学领域的分子谱分析,用于许多疾病(尤其是癌症)的临床决策。由于肿瘤的发生和发展是涉及复合基因组畸变的动态生物学过程,关键挑战在于有效整合来自这些领域的信息,以识别可成药的基因组特征和生物实体,为未来患者开发准确的风险预测谱,并识别新的患者亚群以进行定制治疗和监测。我们为高维多领域癌症数据提出整合概率框架,该框架一致地纳入领域内和领域间的依赖性,以准确检测肿瘤亚型,从而提供与癌症分类相关的基因组畸变目录。我们提出一种创新、灵活且可扩展的贝叶斯非参数框架,用于同时对肿瘤样本和基因组探针进行聚类。我们描述了一种有效的变量选择程序,以识别可能揭示疾病潜在驱动因素的相关基因组畸变。尽管这项工作受到多项肺癌相关研究的启发,但所提出的方法广泛适用于涉及高维数据的各种情境。该方法的成功通过人工数据和来自癌症基因组图谱(The Cancer Genome Atlas)的公开肺癌组学谱得到证明。
引用
@article{arxiv.2202.04799,
title = {A Clustering Approach to Integrative Analysis of Multiomic Cancer Data},
author = {Dongyan Yan and Subharup Guha},
journal= {arXiv preprint arXiv:2202.04799},
year = {2022}
}