中文

利用大数据数据库在蛋白质数据空间中识别病原体

数据库 2015-01-23 v1 定量方法

摘要

当前的宏基因组分析算法需要大量的计算资源,可能会报告过多的假阳性(I 类错误),可能会遗漏生物体(II 类错误/假阴性),或者在大型数据集上扩展性较差。本文探讨了利用大数据数据库技术在蛋白质空间中表征非常大的宏基因组 DNA 序列,最终目标是快速识别患者样本中的病原体。我们的方法利用大数据数据库的能力来容纳遗传数据的大型稀疏关联数组表示,以提取关于数据的统计模式,这些模式可用于多种方式以改进识别算法。

关键词

引用

@article{arxiv.1501.05546,
  title  = {Using a Big Data Database to Identify Pathogens in Protein Data Space},
  author = {Ashley Mae Conard and Stephanie Dodson and Jeremy Kepner and Darrell Ricke},
  journal= {arXiv preprint arXiv:1501.05546},
  year   = {2015}
}

备注

2 pages, 3 figures