中文

基于变分自编码器的多组学数据整合分析:在泛癌分类中的应用

机器学习 2020-02-11 v1 基因组学 机器学习

摘要

临床样本的多个方面可由多种类型的组学数据揭示。多组学数据的整合分析提供患者的全面视图,有潜力促进更精确的临床决策。然而,组学数据通常具有高维特性,分子特征数量庞大而带临床标签的可用样本相对较少。“维度灾难”使得利用诸如 DNA 甲基化与基因表达谱等高维组学数据训练机器学习模型颇具挑战。本文提出一种称为 OmiVAE 的端到端深度学习模型,用于从多组学数据中提取低维特征并对样本分类。OmiVAE 将变分自编码器的基本结构与分类网络结合,以实现面向任务的特征提取与多类分类。OmiVAE 的训练过程包含无分类器的无监督阶段与有分类器的有监督阶段。在无监督阶段,样本的分层聚类结构可在无需标签的情况下自动形成。而在有监督阶段,OmiVAE 在 33 种肿瘤类型与正常样本的 10 折交叉验证后取得 97.49% 的平均分类准确率,优于其他现有方法。从多组学数据学习的 OmiVAE 模型优于仅用单一组学数据的模型,表明不同组学数据类型的互补信息为癌症分类等生物医学任务提供了有用见解。

关键词

引用

@article{arxiv.1908.06278,
  title  = {Integrated Multi-omics Analysis Using Variational Autoencoders: Application to Pan-cancer Classification},
  author = {Xiaoyu Zhang and Jingqing Zhang and Kai Sun and Xian Yang and Chengliang Dai and Yike Guo},
  journal= {arXiv preprint arXiv:1908.06278},
  year   = {2020}
}

备注

7 pages, 4 figures