中文

海量生物数据的熵缩放搜索

数据结构与算法 2015-09-22 v2 基因组学

摘要

许多数据集展现出定义良好的结构,可用于设计更快的搜索工具,但此种加速何时可行并不总是明确的。在此,我们引入一种基于刻画数据集熵与分形维数的相似搜索框架。我们证明,若数据集的分形维数较低,则搜索时间随度量熵(覆盖超球面的数量)缩放,而空间随度量熵与信息论熵(数据的随机性)之和缩放。利用这些思想,我们提出了标准工具的加速版本,在特异性上无损失、在灵敏度上损失极小,用于三个领域——高通量药物筛选(Ammolite,150倍加速)、宏基因组学(MICA,DIAMOND的3.5倍加速[相当于BLASTX的3,700倍])和蛋白质结构搜索(esFragBag,FragBag的10倍加速)。我们的框架可用于实现“压缩组学”,且该一般理论可轻易应用于生物学之外的数据科学问题。

关键词

引用

@article{arxiv.1503.05638,
  title  = {Entropy-scaling search of massive biological data},
  author = {Y. William Yu and Noah M. Daniels and David Christian Danko and Bonnie Berger},
  journal= {arXiv preprint arXiv:1503.05638},
  year   = {2015}
}

备注

Including supplement: 41 pages, 6 figures, 4 tables, 1 box