中文

释放多机构数据的潜力:跨机构基因组数据的整合与协调

基因组学 2024-10-31 v2 机器学习 统计方法学

摘要

癌症是一种由基因组改变驱动的复杂疾病,肿瘤测序正成为癌症患者临床治疗的主流。多机构测序数据的出现为学习真实世界证据以增强精准肿瘤学提供了强大资源。由美国癌症研究协会领导的GENIE BPC项目建立了一个独特的数据库,将基因组数据与在多个癌症中心接受治疗的患者的临床信息联系起来。然而,利用此类多机构测序数据面临重大挑战。基因面板的差异导致在共同基因集上进行分析时信息丢失。此外,测序技术的差异和跨机构的患者异质性增加了复杂性。高数据维度、稀疏的基因突变模式以及单个基因水平的弱信号使问题进一步复杂化。受这些现实世界挑战的启发,我们引入了Bridge模型。它使用分位数匹配的潜变量方法来推导集成特征,以保留共同基因之外的信息,最大化所有可用数据的利用率,同时利用信息共享来增强学习效率和模型的泛化能力。通过提取协调且降噪的低维潜变量,捕获每个个体独特的真实突变模式。我们通过广泛的模拟研究评估了模型的性能和参数估计。从Bridge模型提取的潜特征在预测GENIE BPC数据中六种癌症类型的患者生存率方面持续表现优异。

关键词

引用

@article{arxiv.2402.00077,
  title  = {Unlocking the Power of Multi-institutional Data: Integrating and Harmonizing Genomic Data Across Institutions},
  author = {Yuan Chen and Ronglai Shen and Xiwen Feng and Katherine Panageas},
  journal= {arXiv preprint arXiv:2402.00077},
  year   = {2024}
}