Self-omics:一种面向多组学癌症数据的自监督学习框架
机器学习
2022-10-04 v1 基因组学
摘要
得益于下一代测序技术,我们已获得海量多组学数据。然而,由于其高维性且大量数据未标注,分析此类数据颇具挑战。标注数据缺乏是机器学习中的重大问题,自监督学习(SSL)方法通常用于处理有限标注数据。然而,利用SSL方法挖掘未标注多组学数据间组学关系的研究尚显不足。本工作中,我们开发了一种新颖高效的预训练范式,包含多种SSL组件,包括但不限于对比对齐、从损坏样本恢复数据,以及利用一种组学数据恢复其他组学类型。我们的预训练范式在标注数据有限的下游任务上提升了性能。我们表明,在半监督设定下,我们的方法在TCGA泛癌数据集的癌症类型分类上优于最先进方法。此外,我们表明使用我们的方法预训练的编码器即使不加微调也可作为强大的特征提取器。我们的消融研究表明该方法不过度依赖任一预文本任务组件。我们方法中的网络架构设计用于处理缺失组学类型及多个数据集的预训练与下游训练。我们的预训练范式可扩展至罕见癌症的零样本分类。
引用
@article{arxiv.2210.00825,
title = {Self-omics: A Self-supervised Learning Framework for Multi-omics Cancer Data},
author = {Sayed Hashim and Karthik Nandakumar and Mohammad Yaqub},
journal= {arXiv preprint arXiv:2210.00825},
year = {2022}
}
备注
Preprint of an article published in Pacific Symposium on Biocomputing $\copyright$ 2022 World Scientific Publishing Co., Singapore, http://psb.stanford.edu/