中文

基于 RNA-seq 数据从头组装可变剪接事件的高效算法

数据结构与算法 2014-06-25 v1 计算工程、金融与科学 定量方法

摘要

本论文探讨了在无参考基因组且不组装完整转录本的情况下,识别和量化 RNA-seq 数据中的变异(可变剪接和基因组多态性)的问题。基于每个变异对应于由 RNA-seq 读段构建的 de Bruijn 图中一种可识别模式(即气泡)的基本思想,我们提出了此类图中所有变异的通用模型。随后,我们引入了一种名为 KisSplice 的精确方法来提取可变剪接事件。最后,我们证明该方法比通用转录组组装工具能识别出更多正确的事件。为了应对不断增长的 NGS 数据量,我们致力于使 KisSplice 具有尽可能高的可扩展性。首先,为提高运行时间,我们提出了一种新的多项式延迟算法来枚举气泡。我们表明该算法比以前的方法快几个数量级。其次,为减少内存消耗,我们提出了一种构建和表示 de Bruijn 图的新紧凑方法。我们表明,我们的方法比现有技术少用 30% 到 40% 的内存,而对构建时间的影响微乎其微。此外,我们将开发的列举气泡技术应用于两个经典问题:环枚举和 K-最短路径问题。我们给出了在无向图中列举环的第一个最优算法,改进了 Johnson 算法。这是近 40 年来对该问题的首次改进。随后,我们考虑了经典 K-最短(简单)路径问题的不同参数化:不是限制 st-路径的数量,而是限制 st-路径的权重。我们提出了具有相同时间复杂度但比先前方法使用指数级更少内存的新算法。

关键词

引用

@article{arxiv.1406.6047,
  title  = {Efficient Algorithms for de novo Assembly of Alternative Splicing Events from RNA-seq Data},
  author = {Gustavo Sacomoto},
  journal= {arXiv preprint arXiv:1406.6047},
  year   = {2014}
}

备注

PhD thesis, 139 pages