面向宏基因组数据的深度学习:利用二维嵌入与卷积神经网络
计算机视觉与模式识别
2017-12-04 v1 机器学习
摘要
深度学习(DL)技术在应用于图像、波形和文本等少数领域时取得了前所未有的成功。一般而言,当样本量(N)远大于特征数(d)时,DL 常通过卷积神经网络(CNNs)超越以往的机器学习(ML)技术。然而,在许多生物信息学 ML 任务中,我们遇到相反的情况,即 d 大于 N。在这些情况下,应用 DL 技术(例如前馈网络)会导致严重的过拟合。因此,稀疏 ML 技术(例如 LASSO)通常在这类任务上取得最佳结果。在本文中,我们展示了如何在原本不具有图像结构的数据(特别是宏基因组数据)上应用 CNNs。我们的第一个贡献是展示如何将宏基因组数据以有意义的方式映射为一维或二维图像。基于这种表示,我们随后应用 CNN,旨在预测多种疾病。所提出的方法应用于六个不同的数据集,总共包含来自各种疾病的超过 1000 个样本。这种方法在生物信息学领域的预测任务中可能是一种有前景的方法。
引用
@article{arxiv.1712.00244,
title = {Deep Learning for Metagenomic Data: using 2D Embeddings and Convolutional Neural Networks},
author = {Thanh Hai Nguyen and Yann Chevaleyre and Edi Prifti and Nataliya Sokolovska and Jean-Daniel Zucker},
journal= {arXiv preprint arXiv:1712.00244},
year = {2017}
}
备注
Accepted at NIPS 2017 Workshop on Machine Learning for Health (https://ml4health.github.io/2017/); In Proceedings of the NIPS ML4H 2017 Workshop in Long Beach, CA, USA;