中文

面向高性能计算的生物信息学应用学习算法(U-BRAIN)并行实现探讨

定量方法 2016-10-19 v1

摘要

背景:生物医学研究中产生的大量数据需要复杂的算法方法来进行存储、分析和处理。高性能计算(HPC)似乎是应对这一挑战的灵丹妙药。然而,在此背景下出现了若干难以解决的并行化和负载平衡问题。本文我们讨论了一种通用学习算法的面向HPC的实现,该算法最初为DNA分析而设计,最近扩展为处理数据中的不确定性(U-BRAIN)。U-BRAIN算法是一种学习算法,它寻找一个析取范式(DNF)的布尔公式,其复杂度近似最小,且与一组可能缺失位的数据(实例)一致。公式的合取项以迭代方式计算,通过从给定数据中识别一组条件集合,这些条件必须被所有正实例满足且被所有负实例违反;此类条件允许计算每个属性(文字)的一组系数(相关性),这些系数形成概率分布,从而允许选择项文字。表征它的巨大通用性使得U-BRAIN可应用于许多需要分析数据的领域。然而,运行所需的内存和执行时间分别为O(n3)和O(n5)量级,因此该算法对于海量数据集而言难以承受。

关键词

引用

@article{arxiv.1610.05512,
  title  = {Towards a HPC-oriented parallel implementation of a learning algorithm for bioinformatics applications},
  author = {Gianni D'Angelo and Salvatore Rampone},
  journal= {arXiv preprint arXiv:1610.05512},
  year   = {2016}
}

备注

14 pages, BMC Bioinformatics 2014, 15(Suppl 5):S2; http://www.biomedcentral.com/1471-2105/15/S5/S2