中文

利用自编码器节点显著性区分正常细胞与癌细胞

机器学习 2019-02-01 v1 机器学习

摘要

基因表达谱已被广泛用于刻画细胞对疾病响应的模式。随着数据变得可得,可扩展的学习工具包对于使用深度学习模型处理大型数据集以建模复杂生物过程变得至关重要。我们提出一种自编码器来捕获从基因表达谱中恢复的非线性关系。该自编码器是一种使用人工神经网络的非线性降维技术,可学习无标签数据的隐藏表示。我们在来自美国国家癌症研究所基因组数据共享(National Cancer Institute Genomic Data Commons)的大量肿瘤样本上训练自编码器,获得广义且无监督的潜在表示。我们利用面向高性能计算(HPC)的深度学习工具包 Livermore Big Artificial Neural Network (LBANN) 高效并行化训练算法,将计算时间从数小时缩短至几分钟。利用训练好的自编码器,我们生成了一个小型数据集的潜在表示,该数据集包含多种肿瘤类型的正常细胞与癌细胞配对。我们引入一种称为自编码器节点显著性(ANS)的新度量,以识别最能区分各类细胞配对的隐藏节点。我们将最佳分类节点的发现与主成分分析(PCA)以及 t 分布随机邻域嵌入(t-SNE)的可视化进行比较。我们证明了该自编码器能有效提取数据集中多个学习任务的不同基因特征。

关键词

引用

@article{arxiv.1901.11152,
  title  = {Distinguishing between Normal and Cancer Cells Using Autoencoder Node Saliency},
  author = {Ya Ju Fan and Jonathan E. Allen and Sam Ade Jacobs and Brian C. Van Essen},
  journal= {arXiv preprint arXiv:1901.11152},
  year   = {2019}
}

备注

Second Workshop on HPC Applications in Precision Medicine, June 2018