用于增强肿瘤多组学数据分析的自归一化基础模型
机器学习
2024-11-05 v2
摘要
多组学研究已深化了对癌症异质性与进展的理解。通过多组学方法探索分子数据对于解开癌症背后复杂生物机制至关重要,从而实现更有效的诊断、治疗与预防策略。然而,针对整合所有可用多组学数据来预测患者预后仍是研究的薄弱环节。本文提出SeNMo——一个在33种癌症类型上训练的基础模型。SeNMo在处理高维低长属性的多组学数据方面尤为高效。我们使用来自GDC的全癌症多组学数据(涵盖33个癌症部位)训练SeNMo,用于预测患者总生存率。训练数据包括基因表达、DNA甲基化、miRNA表达、DNA突变、蛋白表达以及临床数据等多种组学模态。SeNMo在两个独立队列中得到验证:Moffitt癌症中心与CPTAC肺鳃状细胞癌。我们采用C-Index评估模型预测患者总生存的性能。SeNMo在训练阶段表现稳定,GDC公开数据的验证C-Index为0.76;在测试阶段,SeNMo在保留测试集上的C-Index为0.758。该模型在预测患者主要癌症类型的分类任务中准确率达99.8%。SeNMo在预测患者主要癌症类型的分类任务中表现出色。SeNMo还在从多组学数据预测三级淋巴结构的任务中展现出显著性能,展现出在不同癌症类型、分子数据类型及临床终点之间的广泛适应性。
引用
@article{arxiv.2405.08226,
title = {Self-Normalizing Foundation Model for Enhanced Multi-Omics Data Analysis in Oncology},
author = {Asim Waqas and Aakash Tripathi and Sabeen Ahmed and Ashwin Mukund and Hamza Farooq and Matthew B. Schabath and Paul Stewart and Mia Naeini and Ghulam Rasool},
journal= {arXiv preprint arXiv:2405.08226},
year = {2024}
}