一种资源节约型概率字典及其在(宏)基因组学中的应用
数据结构与算法
2016-05-27 v1 基因组学
摘要
基因组学和宏基因组学领域产生了海量短基因组序列集合,带来了其特有的高性能问题。为从当前测序技术生成的巨大数据集中提取相关信息,必须依赖极具可扩展性的方法和解决方案。为数十亿对象建立索引是一项被认为过于昂贵但又是该领域基本需求的任务。本文中,我们提出一种可扩展至数十亿元素的简单索引结构,并给出在基因组学和宏基因组学中的两个直接应用。我们展示我们的方案解决了其他已知方案均无法扩展的问题实例。我们相信许多工具和应用可受益于我们提供的基本数据结构或基于此结构开发的应用。
引用
@article{arxiv.1605.08319,
title = {A resource-frugal probabilistic dictionary and applications in (meta)genomics},
author = {Camille Marchet and Antoine Limasset and Lucie Bittner and Pierre Peterlongo},
journal= {arXiv preprint arXiv:1605.08319},
year = {2016}
}
备注
Submitted to PSC 2016