中文

SubOmiEmbed:用于癌症类型分类的多组学数据自监督表示学习

机器学习 2022-02-04 v1 定量方法

摘要

对于个性化医疗而言,高维组学数据中蕴含着非常关键的内在信息,但由于分子特征数量庞大而可用样本稀少,这些信息难以被捕捉。不同类型的组学数据展现了样本的不同方面。多组学数据的整合与分析为我们提供了肿瘤的宏观视图,从而可改善临床决策。组学数据(主要是 DNA 甲基化与基因表达谱)通常是具有大量分子特征的高维数据。近年来,变分自编码器(VAE)已被广泛用于将有图像和文本数据嵌入到低维潜在空间中。在本项目中,我们拓展了使用 VAE 模型进行低维潜在空间提取的思路,并结合特征子集化的自监督学习技术。借助 VAE,核心思想是使模型从不同类类型的组学数据中学习有意义的表示,进而用于癌症类型分类等下游任务。主要目标是克服维数灾难,并整合甲基化与表达数据以结合相同组织样本不同方面的信息,从而有望提取具有生物学意义的特征。我们的扩展在于训练编码器与解码器仅从数据的某个子集重建数据。通过此举,我们迫使模型在潜在表示中编码最重要的信息。我们还为子集添加了标识,使模型在训练与测试时知晓当前输入的是哪个子集。我们实验了该方法,发现 SubOmiEmbed 仅使用数据的子集且网络规模远小于基线 OmiEmbed,却取得了与之相当的结果。本工作可进一步改进以整合基于突变的基因组数据。

关键词

引用

@article{arxiv.2202.01672,
  title  = {SubOmiEmbed: Self-supervised Representation Learning of Multi-omics Data for Cancer Type Classification},
  author = {Sayed Hashim and Muhammad Ali and Karthik Nandakumar and Mohammad Yaqub},
  journal= {arXiv preprint arXiv:2202.01672},
  year   = {2022}
}